跳转到正文

集群与节点

创建任务前,先用集群和节点信息确认各角色会运行在哪里。集群代表已接入 RLark 的数据平面,Node 资源则记录其中每个计算节点的状态、标签和资源。

确认集群可以承载任务

任务创建器中的集群字段会筛选该集群的候选节点、设备和存储配置。提交前还应确认:

  • Agent 最近仍能与 RLark 通信;
  • 集群中有符合角色和标签要求的节点;
  • 目标节点的可分配资源足以满足每个 Worker 的请求;
  • 任务所需的镜像、StorageClass 和网络路径都能在该集群使用。

集群出现在列表中,只说明 RLark 中仍有该集群的登记或最近上报信息,不保证新任务一定能调度成功。

集群字段只用于筛选候选项

Job 的 Task 模板没有独立的 cluster 字段。RLark 会根据 Task 的 nodeSelector 匹配 Node,并在匹配结果所在的命名空间中创建 Task。因此,提交前必须确认选择器在全部 Node 中只命中预期集群。

查看节点状态和资源

Node 详情可用于核对以下信息:

  • 接入形态:Kubernetes、Docker 或 Raw;
  • 节点类别:cloud、edge 或 robot;
  • 阶段:Online 或 Offline;
  • 可调度性:由 unschedulable 单独记录;
  • 资源:Capacity、Allocatable 和 Used;
  • 系统信息:架构、内核、操作系统和 Agent 版本;
  • 地址和原因:节点地址,以及离线等状态的说明。

其中:

  • Capacity 是节点报告的总资源容量;
  • Allocatable 是扣除系统和 Agent 预留后,可供工作负载调度的资源;
  • Used 是 RLark 最近收到的使用量,可能与目标集群的实时状态存在短暂延迟。

区分在线状态和可调度状态

  • Online 表示节点最近与 RLark 保持连接;
  • Offline 表示节点不可用或没有正常上报,可结合 reason 排查;
  • unschedulable: true 表示节点不接收新的工作负载,即使它仍为 Online。

遇到“节点在线但任务不启动”时,还要检查可调度标志、节点标签、资源请求、镜像、存储和网络依赖。

为任务选择节点

Task 通过 nodeSelector 匹配节点标签。创建器会在所选集群内计算匹配节点数,并据此生成副本数;它不会显示其他集群中使用相同标签的节点。

按以下规则准备选择器:

  1. 使用由不同标签键组成的单值条件,例如 node-role=rolloutgpu-type=h100
  2. 确认标签键和值的大小写完全一致。
  3. 确认所有匹配节点都属于预期集群和 Domain,且为 Online、可调度状态。
  4. 确认每个角色至少匹配一个节点。
  5. 请管理员在完整 Node 清单中记录选择器、所有匹配 Node 及其命名空间。

不要使用空选择器或同一标签键的多个值。如果完整匹配结果跨越多个集群,应先补充能区分集群的标签,再提交任务。创建器中显示的集群名称和匹配数量不能替代这项检查。

旧版文档中的 Worker Group 和 node_names 不适用于这里。RLark 由 Job 模板生成 Task,再由 Task 的节点选择和工作负载模板决定 Worker。