跳转到正文

监控训练指标

Job 详情包含监控标签,但该页面暂时没有可用的 Job Prometheus 指标。

确认监控页是否有数据

在任务列表中选择目标任务,再打开监控标签。页面会显示“指标待接入”和“当前环境暂无可用的 Prometheus 指标数据”。Job metrics 接口返回 501 Not Implemented,因此控制台暂时不提供任务级或 Worker 级 CPU、内存、GPU、跨集群网络和 RDMA 时序数据。

占位数字不能用于验收

如果页面或 Worker 展开区显示 CPU、内存、GPU、网络、延迟或 FPS 示例数字,请勿用于容量规划、性能比较、告警或验收。

指标不可用时检查任务

可以通过以下入口检查任务:

  • Worker 标签检查 Task、Worker 和 Pod 的实际阶段、节点、IP 与网络域;
  • 日志中检查主容器输出;
  • 节点详情中查看节点上报的 CPU、内存和 GPU 容量;
  • 如果训练程序写入 TensorBoard 事件,使用TensorBoard检查训练曲线;
  • 对时间序列、告警或长期保留需求,使用部署环境中经批准的外部监控系统。

这些入口分别反映 Pod 状态、应用日志、节点容量和训练曲线,不能替代完整的任务级时序监控。