跳转到正文

场景实战

本节帮助你把具体的 RLinf 工作负载整理成 RLark Job,包括角色、Task、节点选择、运行环境和存储配置。每个场景都会说明需要准备哪些输入、如何接入 RLark,以及哪些检查通过后才能提交。

先查看场景状态

“可用于规划”表示可以按照文档整理任务,但平台管理员确认全局节点匹配,并证明 Header 角色只匹配 1 个 Node 后才能提交。“待验证”和“暂不提供”的场景没有可直接执行的步骤,请勿从旧版文档复制命令运行。

当前场景

先根据文档状态判断场景能否进入提交步骤。

场景文档状态说明
迁移已有 RLinf 工作负载可用于规划可以按当前 Job/Task 模型整理配置;提交前仍需管理员确认单值选择器只命中目标集群,而且 Header 角色恰好匹配 1 个 Node。
ManiSkill PPO待验证尚未提供固定配置、不可变镜像、启动命令和一次完整运行记录。
ManiSkill SAC待验证尚未提供固定配置、运行依赖、输出约定和一次完整运行记录。
真实机器人 Env Worker暂不提供设备、驱动、SDK、权限和现场安全条件尚未确认。
Franka 数据采集暂不提供尚未提供可复用的采集配置、镜像、设备拓扑、输出格式和安全流程。
Franka Peg Insertion 多角色训练暂不提供尚未提供可复用的多角色配置、控制链路、模型路径、运行记录和真机安全流程。

真机条件未确认时只使用仿真或隔离环境

连接真实机器人前,必须确认安全责任人、现场操作员、隔离区域、急停与断能手段、设备和固件兼容性、故障恢复方法以及组织审批。本节不提供机器人连接、控制、复位、采集或训练命令;准备真机任务前,请先阅读真实机器人安全要求

可用场景的前提

使用迁移已有 RLinf 工作负载前,应先在工作负载所属项目中确认:

  • 精确的镜像引用、启动命令和配置文件;
  • 输入、checkpoint、日志和输出路径;
  • 每个进程角色的资源与放置要求;
  • 目标集群的镜像、存储、网络和配额条件;
  • 可以从日志或输出中确认的启动成功、运行正常和失败信号。

提交时,镜像、配置、脚本和挂载会写入 RLark Job,平台据此创建并运行 Worker。RLinf/Hydra 配置和算法依赖需要在打包前完成验证;任务运行后,再按启动清单中的业务信号和持久输出验收结果。

根据已有 Job 整理配置时

Job 详情可以查看已提交的角色配置、最近一次 Pod 信息和当前日志,但不会自动记录完整的 RLinf commit、镜像实际 digest、最终 Hydra 配置、CLI override 来源、数据版本、checkpoint 完整性和业务成功标准。列表中的 Running、Worker 数或 Ray 启动日志也不能补齐这些信息。

如果要把已有 Job 整理成可复用场景,请先补齐启动清单已验证的部署参数,再按照检查 RLinf 任务是否正常运行确认结果。复制任务只能复制部分配置,不能代替这些准备工作。

从旧平台迁移时需要调整的内容

  • 不复制旧版 JobSpec、Worker Group、显式节点列表或自动 rank 字段;
  • 使用当前 Job 的 spec.tasks、Task 角色、nodeSelector、副本和资源请求重新填写任务配置;
  • Web 控制台迁移流程只使用 Kubernetes StatefulSet 工作负载;即使 API 资料中出现 Docker 或 Raw 类型,也不要用于本流程;
  • 节点选择器只使用管理员验证过的单值条件组合;同一标签键的多个值不适用于本流程;
  • Head 标记作用于整个 Task 的所有副本;Header 角色只能匹配 1 个 Node,否则会重复启动 Ray Head 和运行脚本;
  • YAML 预览只证明将要提交的 RLark 资源结构,不证明镜像、命令、训练结果或硬件可用。

当前可用范围

当前只有“迁移已有 RLinf 工作负载”提供通用配置方法,它不包含可直接运行的镜像、命令或硬件参数,也不能绕过节点选择器限制。管理员没有确认全局节点匹配结果时,请勿提交。迁移其他场景时,请先准备明确的版本、不可变镜像、配置、命令和目标环境,再完成一次完整的运行验证;真机场景还必须完成单独的安全确认。