主题
功能可用情况与限制
本页帮助你判断一项功能可以直接使用、需要配置工作负载或接入外部服务,还是应先请平台管理员确认。界面中出现入口并不代表所有环境都已经配置该功能。
| 状态 | 如何处理 |
|---|---|
| 可使用 | 按对应指南操作,并在目标任务中检查结果。 |
| 需配置工作负载 | RLark 提供运行、挂载或代理能力;把所需代码、配置、数据或输出路径放入镜像、脚本或挂载,再从任务结果验证。 |
| 需接入外部服务 | 先确认目标环境允许访问,再在工作负载中配置外部服务并检查运行记录。 |
| 需完成任务预检 | 提交前核对表单无法判断的镜像内容、应用配置、路径和外部链路。 |
| 使用前确认 | 先由平台管理员确认目标环境、权限和端到端链路。 |
| 暂不可用 | 控制台或后端没有提供可依赖的结果。 |
准备 RLinf 任务
| 功能 | 状态 | 使用方式或限制 |
|---|---|---|
| RLinf 版本兼容 | 使用前确认 | 没有统一的 RLinf 版本、分支或 commit 兼容矩阵。每次运行都要固定代码来源和镜像 digest,并按RLark 与 RLinf完成确认。 |
| RLinf 来源与适配 | 需配置工作负载 | RLark 按镜像中的代码启动工作负载,不区分上游、fork 或适配层。请在本次运行记录中保存来源、commit、必要补丁和镜像 digest。 |
| Hydra 配置 | 需配置工作负载 | Hydra 配置随镜像、外部文件和命令行 override 进入工作负载。Job 定义资源和运行结构;YAML 预览不合并或展示最终 Hydra 配置。 |
| 角色与放置 | 可使用 | 使用角色、nodeSelector、副本、GPU 和设备资源指定落点。把 node_groups、component_placement、hardware rank 和 env_configs 逐项映射到这些字段。见任务创建字段。 |
| 启动前检查 | 需完成任务预检 | 表单只做字段级检查。提交前按训练任务启动前检查核对 Hydra、镜像内容、路径、placement 和机器人连通性。 |
运行和排查任务
| 功能 | 状态 | 使用方式或限制 |
|---|---|---|
| Ray 生命周期 | 可使用 | Kubernetes Task 会为 Job 启动 Ray Head 和 Worker,不会连接已有 Ray 集群。Head Task 必须只有一个副本。 |
RLINF_NODE_RANK 与准备脚本 | 可使用 | RLark 在 ray start 前计算 rank 并执行角色准备脚本。不要覆盖平台保留变量。见运行环境与环境变量。 |
| 任务状态 | 可使用,但需结合业务信号 | Task 和 Pod 状态可用于判断调度与运行情况。StatefulSet Task 不会可靠上报业务成功或失败;训练结论应来自日志、指标、checkpoint 和持久输出。 |
| Worker 重试历史 | 暂不可用 | 控制台不显示 attempt 编号、实例替换关系、终止时间或完整 previous logs。同名 Worker 行不能单独用于建立重试顺序。 |
| 停止和恢复 | 可使用 | 恢复任务会重新创建进程,不会恢复 Ray actor 或容器内存。只有运行命令明确读取持久 checkpoint 时,训练才会从已保存状态继续。 |
| 自动故障分类 | 暂不可用 | 可以查看状态和原始日志,但没有覆盖 Pending、镜像、GPU、Ray、NCCL、网络、/dev/shm 和机器人错误的统一分类器。 |
状态判断和排障步骤见状态与生命周期和训练任务与 Worker 排障。
记录指标、checkpoint 和运行信息
| 功能 | 状态 | 使用方式或限制 |
|---|---|---|
| Job 指标 | 暂不可用 | Job metrics 接口返回 501 Not Implemented。任务详情页和 Worker 展开区中的占位数字不能作为训练指标。 |
| TensorBoard | 需配置工作负载 | RLark 可以代理 Head Task 的 TensorBoard。训练程序需要把 event 文件写入配置目录,并将该目录放在需要持久保存的挂载中。 |
| W&B 与 SwanLab | 需接入外部服务 | 目标环境允许外部连接时,在工作负载中配置 W&B 或 SwanLab 并检查运行记录。RLark 不托管或代理这两类服务。见配置实验追踪。 |
| Checkpoint | 需配置工作负载 | RLark 提供存储挂载;训练程序需要按自身布局写入持久 checkpoint,并通过 resume_dir 读取目标记录。RLark 不检查 FSDP/Megatron 写入的原子性或完整性,也不自动选择恢复位置。见保留并恢复 RLinf 训练。 |
| 数据与产物关联 | 暂不可用 | 控制台没有专门记录数据集、模型、LoRA、checkpoint、评测结果、视频和 Git commit 关系的功能。 |
| 跨运行比较 | 暂不可用 | 控制台不能按配置、指标或视频比较多个运行。 |
为了复现运行,请在版本控制和实验记录中保存镜像 digest、代码 commit、原始与解析配置、命令行 override、数据和模型版本、Job YAML、输出前缀及外部跟踪 ID。
使用存储、网络和机器人资源
| 功能 | 状态 | 使用方式或限制 |
|---|---|---|
| 对象存储与文件浏览 | 使用前确认 | StorageClass、Secret、PVC、CSI 和容器挂载必须在每个目标集群中正常工作。在指定的测试前缀中使用不含敏感信息、名称唯一的小文件,验证列出、上传、下载和任务内读取。 |
hostPath | 使用前确认 | 只在被调度节点的本地路径上有效。重调度后,路径可能不存在或内容不同;不要把它当作跨节点共享存储。 |
| 网络域 | 使用前确认 | Domain、网络组件和跨集群通道必须在目标环境完成双向端口测试。RLark 不会自动选择 RLINF_COMM_NET_DEVICES。见网络域。 |
| 节点类别 | 可使用 | 云算力、端算力和端真机由 rlark.io/node-category 标签区分;其他值或缺少标签会归入“其他”。 |
| 具身实时通道 | 使用前确认 | 传感器、视频、控制和健康状态的支持范围由目标环境的设备接入方案决定。 |
| 真实机器人操作 | 暂不操作 | 在设备独占、人工确认、动作边界、急停、断连安全状态和恢复授权全部完成前,不要下发真机动作。见真实机器人安全要求。 |
使用高权限入口和自动化
| 功能 | 状态 | 使用方式或限制 |
|---|---|---|
| 控制台登录 | 可用于进入界面 | 用户端和管理端使用不同入口。浏览器登录状态不是 API 凭据,也不能替代组织的身份认证和授权。 |
| RBAC、租户隔离与审计 | 使用前确认 | 共享或生产环境中,先从平台与安全负责人处取得角色权限、资源隔离、操作审计、凭据脱敏和轮换方式。见安全与治理。 |
| SSH 与 WebTerminal | 使用前确认 | 这些入口可以访问运行中的容器和挂载。只有获授权人员可以使用;不要输出 Secret,也不要把容器内临时修改当作持久配置。 |
| 配额和成本估算 | 暂不可用 | 控制台没有面向用户的配额、排队和成本估算结果。提交前向平台管理员确认可用资源和用量规则。 |
| Workflow DAG | 使用前确认 | Workflow 可以表达依赖并创建子 Job,但会受到 StatefulSet Job 无法可靠上报终态的限制。见工作流。 |
| API 与 CLI | 使用前确认 | 只有平台管理员提供匹配目标环境的端点、认证、授权和版本信息后,才能用于自动化。见API 与 CLI。 |
| YAML 预览 | 可使用 | 用于核对即将提交的 Job CRD;不能用作通用 YAML 导入、版本迁移或审计记录。 |
| 环境版本与支持 | 使用前确认 | 向平台管理员确认环境版本、维护窗口、兼容要求和问题处理渠道。 |
发现页面行为与本页不一致时,记录环境、页面、时间、资源名称和错误信息,再交给平台管理员确认。不要通过创建、停止、删除、终端命令或机器人动作来试探权限或功能。