跳转到正文

停止、恢复或删除训练任务

在任务列表中打开目标任务行右侧的操作菜单,可以停止、启动或删除任务。已停止任务的恢复操作显示为启动

停止任务

对处于等待中运行中的 Job,停止会把 spec.stopped 设为 true。平台随后把各 Task 工作负载的期望副本数降为 0,并将 Job 转入已停止状态;现有 Worker Pod 会被终止。

失败任务不是可停止状态

Failed 是终态。即使菜单仍显示停止,失败任务也不会转为已停止。请保存日志和输出,修复配置后复制为新 Job。

操作前先确认训练输出已经写入需要保留的存储。然后:

  1. 打开任务行的操作菜单。
  2. 选择停止
  3. 等待状态更新为已停止,并在详情页确认 Worker 已退出。

没有二次确认

选择停止后会立即提交操作,不显示确认对话框。点击前请核对任务名称。

启动已停止任务

启动会把 spec.stopped 清为 false。平台把 Job 从已停止转回等待中,再按原配置重新创建和调度工作负载。

  1. 打开已停止任务的操作菜单。
  2. 选择启动
  3. 等待状态从等待中进入运行中,并重新检查 Worker 与日志。

启动会创建新的 Pod 和 Ray 进程,不会保留原容器的内存状态。能否从 checkpoint 恢复,取决于运行脚本和持久存储中的 checkpoint。Succeeded 和 Failed 都是终态,不能通过停止再启动进入新的运行周期。

启动也不会自动发现或选择 RLinf checkpoint。原 Job 的运行脚本没有明确解析 runner.resume_dir 时,新 Pod 会按原命令从头执行。需要恢复训练时,先阅读保留并恢复 RLinf 训练

删除任务

删除会移除 Job 资源。受 Job 控制的 Task 和下游工作负载会进入清理流程,控制台没有恢复已删除 Job 的入口。

  1. 确认日志、检查点和其他需要保留的输出已经导出或写入持久存储。
  2. 打开任务行的操作菜单,选择删除
  3. 在“确定删除任务”对话框中再次核对名称并确认。
  4. 确认任务从列表中消失。

删除 Job 不等于删除对象存储或主机目录中的所有训练数据。需要清理外部数据时,应按对应存储的流程单独确认范围和执行。

各对象的影响

对象停止启动删除
Job 配置保留,设置停止标志保留并清除停止标志删除,控制台没有恢复入口
Task保留,Kubernetes 工作负载副本数协调为 0按原模板恢复副本随 Job 的所有者关系清理
Pod、Ray actor 和进程内状态Pod 终止,状态丢失新建 Pod 和新的 Ray 运行时清理受控工作负载和 Ray Service
容器文件系统Pod 终止后不能依赖其保留新 Pod 不继承旧容器内容不能从 RLark 恢复
当前 Pod 日志Pod 消失后不保证还能从 Job 日志页取得新 Pod 产生新日志Job 日志入口消失;操作前先导出所需快照
Task 自动创建的 PVC停止时保留重新由 Task 使用Task 清理流程会删除其拥有的 PVC
Bucket 对象或主机目录内容不由停止删除只有正确挂载和路径才能再次读取不一定删除,但 PVC/Job 引用会消失
RLinf checkpointRLark 不触发保存或校验只有运行脚本/配置明确设置才会加载是否仍存在取决于写入位置和外部存储
机器人或外部设备状态Pod 终止后,由现场人员检查设备已经安全停止重新连接前需要重新授权并现场检查删除记录后,由现场人员检查断连、急停或复位状态

先保存再停止或删除

停止没有二次确认,也不会等待 RLinf 完成 checkpoint。删除还会清理 Task 拥有的 PVC。执行前应检查持久输出、保存 Job YAML、导出所需日志,并确认外部设备已经由现场负责人置于安全状态。