主题
停止、恢复或删除训练任务
在任务列表中打开目标任务行右侧的操作菜单,可以停止、启动或删除任务。已停止任务的恢复操作显示为启动。
停止任务
对处于等待中或运行中的 Job,停止会把 spec.stopped 设为 true。平台随后把各 Task 工作负载的期望副本数降为 0,并将 Job 转入已停止状态;现有 Worker Pod 会被终止。
失败任务不是可停止状态
Failed 是终态。即使菜单仍显示停止,失败任务也不会转为已停止。请保存日志和输出,修复配置后复制为新 Job。
操作前先确认训练输出已经写入需要保留的存储。然后:
- 打开任务行的操作菜单。
- 选择停止。
- 等待状态更新为已停止,并在详情页确认 Worker 已退出。
没有二次确认
选择停止后会立即提交操作,不显示确认对话框。点击前请核对任务名称。
启动已停止任务
启动会把 spec.stopped 清为 false。平台把 Job 从已停止转回等待中,再按原配置重新创建和调度工作负载。
- 打开已停止任务的操作菜单。
- 选择启动。
- 等待状态从等待中进入运行中,并重新检查 Worker 与日志。
启动会创建新的 Pod 和 Ray 进程,不会保留原容器的内存状态。能否从 checkpoint 恢复,取决于运行脚本和持久存储中的 checkpoint。Succeeded 和 Failed 都是终态,不能通过停止再启动进入新的运行周期。
启动也不会自动发现或选择 RLinf checkpoint。原 Job 的运行脚本没有明确解析 runner.resume_dir 时,新 Pod 会按原命令从头执行。需要恢复训练时,先阅读保留并恢复 RLinf 训练。
删除任务
删除会移除 Job 资源。受 Job 控制的 Task 和下游工作负载会进入清理流程,控制台没有恢复已删除 Job 的入口。
- 确认日志、检查点和其他需要保留的输出已经导出或写入持久存储。
- 打开任务行的操作菜单,选择删除。
- 在“确定删除任务”对话框中再次核对名称并确认。
- 确认任务从列表中消失。
删除 Job 不等于删除对象存储或主机目录中的所有训练数据。需要清理外部数据时,应按对应存储的流程单独确认范围和执行。
各对象的影响
| 对象 | 停止 | 启动 | 删除 |
|---|---|---|---|
| Job 配置 | 保留,设置停止标志 | 保留并清除停止标志 | 删除,控制台没有恢复入口 |
| Task | 保留,Kubernetes 工作负载副本数协调为 0 | 按原模板恢复副本 | 随 Job 的所有者关系清理 |
| Pod、Ray actor 和进程内状态 | Pod 终止,状态丢失 | 新建 Pod 和新的 Ray 运行时 | 清理受控工作负载和 Ray Service |
| 容器文件系统 | Pod 终止后不能依赖其保留 | 新 Pod 不继承旧容器内容 | 不能从 RLark 恢复 |
| 当前 Pod 日志 | Pod 消失后不保证还能从 Job 日志页取得 | 新 Pod 产生新日志 | Job 日志入口消失;操作前先导出所需快照 |
| Task 自动创建的 PVC | 停止时保留 | 重新由 Task 使用 | Task 清理流程会删除其拥有的 PVC |
| Bucket 对象或主机目录内容 | 不由停止删除 | 只有正确挂载和路径才能再次读取 | 不一定删除,但 PVC/Job 引用会消失 |
| RLinf checkpoint | RLark 不触发保存或校验 | 只有运行脚本/配置明确设置才会加载 | 是否仍存在取决于写入位置和外部存储 |
| 机器人或外部设备状态 | Pod 终止后,由现场人员检查设备已经安全停止 | 重新连接前需要重新授权并现场检查 | 删除记录后,由现场人员检查断连、急停或复位状态 |
先保存再停止或删除
停止没有二次确认,也不会等待 RLinf 完成 checkpoint。删除还会清理 Task 拥有的 PVC。执行前应检查持久输出、保存 Job YAML、导出所需日志,并确认外部设备已经由现场负责人置于安全状态。