主题
配置实验追踪
RLark 可以代理访问 TensorBoard。使用 W&B 或 SwanLab 时,镜像中的 RLinf 会直接连接相应服务;项目、run 名称和日志路径随 RLinf 配置提供,凭据通过组织批准的 Secret 注入方式传入训练进程。控制台不提供跨 run 的配置、指标或视频比较。
选择实验追踪后端
| 后端 | RLinf 配置 | 在 RLark 中使用 |
|---|---|---|
| TensorBoard | 通过 runner.logger.logger_backends 启用;RLinf 把 event 和 resolved config.yaml 写入日志目录 | 为 Head Task 填写 tensorBoardDir 后,通过控制台代理访问 Pod 的 6006 端口。 |
| W&B | RLinf logger 可创建 run、上传 resolved config 和指标 | 训练进程使用 RLinf 配置和凭据直接连接 W&B;控制台没有托管入口、凭据注入或比较页面。 |
| SwanLab | RLinf logger 可按配置创建实验并记录 resolved config 和指标 | 训练进程使用 RLinf 配置和凭据直接连接 SwanLab;控制台没有托管入口、凭据注入或比较页面。 |
使用前请确认目标镜像包含对应依赖、目标集群可以访问外部服务,并且账号已经获准使用该服务。
记录 Job 与外部 run 的对应关系
为每次运行记录:
- RLark Job 名称;
- tracker 的 project、experiment/run 名称和 URL 或 ID;
- RLinf 代码 ref、镜像 digest 和脱敏最终配置;
- 数据、基础模型和 checkpoint 版本;
- 日志与视频的持久路径。
控制台不会自动关联 Job 与外部 run。请使用团队约定的唯一名称或标签,并把对应关系保存到实验记录中。
TensorBoard
- 在 RLinf 配置中启用 TensorBoard,并确认实际 event 目录。
- 让该目录位于 Head Task 容器可见的持久挂载中;需要跨 Pod 保留时不能依赖自动
emptyDir。 - 在 Job 公共配置中把同一个容器绝对路径填入TensorBoard 日志目录。
- 确认 Head Task 只有 1 个副本,再检查 YAML 中的
tensorBoardDir。 - 运行后从 Job 概览打开 TensorBoard。如果页面暂时无法打开,请等待 Head Task、sidecar 和 event 文件就绪后重试。
详细处理方法见打开 TensorBoard。
W&B 与 SwanLab
- 在外部 RLinf/Hydra 配置中选择后端,并配置 project、experiment 和后端特有选项。
- 确认每个需要访问服务的进程具有网络路径和组织授权。
- 使用组织批准的 Secret 注入方式提供令牌。不要把 token 放入 RLark 环境变量表单、运行脚本、YAML 预览或日志。
- 如需保留离线目录或稍后重试上传,把 RLinf
log_path放在持久挂载中。 - 在外部服务中验证 run ID、resolved config 和首个指标,再记录与 RLark Job 的对应关系。
训练工作负载直接调用 W&B 和 SwanLab;需要重试上传、比较配置或管理训练产物版本时,请使用对应服务的能力或团队现有流程。
与 Prometheus 监控的区别
实验追踪显示训练程序主动上报的业务指标。Job 监控标签用于平台资源和网络指标,但该接口返回 501 Not Implemented,页面暂时没有可用数据。启用 TensorBoard、W&B 或 SwanLab 不会把数据同步到该页面;可用的替代入口见监控训练指标。