Skip to content

接入集群并核对设备 ​

场景目标 ​

集群状态可用,4 张 NPU 卡全部出现在预期节点,并可关联兼容资源规格。

适用角色 ​

  • 平台运营方

开始前准备 ​

  • 准备集群地址、注册信息、网络路由和所需 Agent 或凭证。
  • 记录预期节点数以及 4 张 NPU 卡的物理分布。

功能入口 ​

  • 角色:运营管理员
  • 菜单:AI基础设施 > On-Prem > 资源池 > 集群管理
  • 路由:/powerone/resourcepool/cluster

操作步骤 ​

  1. 确认地域和可用区已创建。

  2. 点击 集群注册,填写 kubeconfig、API Server、认证方式和网络信息。

  3. 提交后等待集群进入“可用”状态。

  4. 打开集群详情和节点列表,核对节点均为 Ready。

  5. 核对设备总量,确认目标 NPU 数量为 4,且没有掉卡或重复上报。

  6. 打开 Cluster Details,核对集群所属地域、可用区、状态、关联规格和存储配置。

  7. 打开 Cluster Nodes,逐节点确认节点状态、设备可见性和资源上报结果,尤其是承载加速卡的节点。

  8. 如果集群处于禁用状态,在重新启用并确认节点恢复正常前,不要将其用于新的资源创建。

集群管理页面

4 张 NPU 卡的核对方法 ​

检查项预期结果
集群状态可用
节点状态所有承载 NPU 的节点均为 Ready
设备总量4 张 NPU 卡
可分配量扣除运行中作业后与实际占用一致
资源 key与加速卡管理和规格指标一致

完成检查 ​

用途: 以下检查是当前功能任务的退出条件,用于判断操作结果是否可观察、可复核,以及是否可以继续当前场景的下一步。它不是操作步骤的重复;任一项不满足时,请按下方“常见失败分支”继续排查。

检查项通过标准
1集群、节点和设备信息均可见。
24 张 NPU 卡全部被识别。
3测试作业可以申请至少 1 张 NPU 卡并进入调度流程。

常见失败分支 ​

现象优先检查
集群注册失败地址、网络、注册信息、Agent 状态和时间同步
只发现部分 NPU 卡节点健康、驱动、设备插件、加速卡映射和硬件可见性
Cluster Details 中没有预期数据集群状态、地域/可用区、权限范围、同步时间以及集群是否已完成接入
Cluster Nodes 为空集群可用性、节点是否完成注册、权限范围以及同步或采集状态
已禁用集群仍可被选择刷新页面,重新核对集群状态和下游关联;在选择范围修正前不要提交作业
修改集群存储后作业无法访问集群存储关联、地域/可用区绑定、存储组件健康状态和作业挂载配置

操作手册 ​

查看集群注册和维护完整说明