跳转到正文

配置实验追踪

RLark 可以代理访问 TensorBoard。使用 W&B 或 SwanLab 时,镜像中的 RLinf 会直接连接相应服务;项目、run 名称和日志路径随 RLinf 配置提供,凭据通过组织批准的 Secret 注入方式传入训练进程。控制台不提供跨 run 的配置、指标或视频比较。

选择实验追踪后端

后端RLinf 配置在 RLark 中使用
TensorBoard通过 runner.logger.logger_backends 启用;RLinf 把 event 和 resolved config.yaml 写入日志目录为 Head Task 填写 tensorBoardDir 后,通过控制台代理访问 Pod 的 6006 端口。
W&BRLinf logger 可创建 run、上传 resolved config 和指标训练进程使用 RLinf 配置和凭据直接连接 W&B;控制台没有托管入口、凭据注入或比较页面。
SwanLabRLinf logger 可按配置创建实验并记录 resolved config 和指标训练进程使用 RLinf 配置和凭据直接连接 SwanLab;控制台没有托管入口、凭据注入或比较页面。

使用前请确认目标镜像包含对应依赖、目标集群可以访问外部服务,并且账号已经获准使用该服务。

记录 Job 与外部 run 的对应关系

为每次运行记录:

  • RLark Job 名称;
  • tracker 的 project、experiment/run 名称和 URL 或 ID;
  • RLinf 代码 ref、镜像 digest 和脱敏最终配置;
  • 数据、基础模型和 checkpoint 版本;
  • 日志与视频使用的 StorageClass 和对象前缀;使用主机目录时,记录实际节点和节点上的源路径。

控制台不会自动关联 Job 与外部 run。请使用团队约定的唯一名称或标签,并把对应关系保存到实验记录中。

TensorBoard

  1. 在 RLinf 配置中启用 TensorBoard,并确认实际 event 目录。
  2. 让该目录位于 Head Task 容器可见的对象存储挂载中;需要跨 Pod 保留时不能依赖自动 emptyDir。使用主机目录时,只有 Pod 回到保留原目录的节点才能继续读取。
  3. 在 Job 公共配置中把同一个容器绝对路径填入TensorBoard 日志目录
  4. 确认 Head Task 只有 1 个副本,再检查 YAML 中的 tensorBoardDir
  5. 运行后从 Job 概览打开 TensorBoard。如果页面暂时无法打开,请等待 Head Task、sidecar 和 event 文件就绪后重试。

详细处理方法见打开 TensorBoard

W&B 与 SwanLab

  1. 在外部 RLinf/Hydra 配置中选择后端,并配置 project、experiment 和后端特有选项。
  2. 确认每个需要访问服务的进程具有网络路径和组织授权。
  3. 使用组织批准的 Secret 注入方式提供令牌。不要把 token 放入 RLark 环境变量表单、运行脚本、YAML 预览或日志。
  4. 如需保留离线目录或稍后重试上传,把 RLinf log_path 放在经过验证的对象存储挂载中;只在节点和目录保留方式已经确认时使用主机目录。
  5. 在外部服务中验证 run ID、resolved config 和首个指标,再记录与 RLark Job 的对应关系。

训练工作负载直接调用 W&B 和 SwanLab;需要重试上传、比较配置或管理训练产物版本时,请使用对应服务的能力或团队现有流程。

挂载方式和容器内挂载路径的选择见在训练任务中使用存储

与 Prometheus 监控的区别

实验追踪显示训练程序主动上报的业务指标。Job 监控标签用于平台资源和网络指标,但该接口返回 501 Not Implemented,页面暂时没有可用数据。启用 TensorBoard、W&B 或 SwanLab 不会把数据同步到该页面;可用的替代入口见监控训练指标