Checkpoint, migrate, and resume GPU jobs across shared research clusters so maintenance windows, node failures, and queue policy stop erasing work.