统计概览
功能概述
| 项目 | 内容 |
|---|---|
| 适用角色 | 运营管理员 |
| 导航路径 | AI基础设施 > On-Prem > 监控 > 统计概览 |
| 页面路由 | /powerone/monitor/overview |
| 管理对象 | 资源池总览、集群数量、节点状态、作业分布和资源容量 |
新手理解
统计概览像资源池驾驶舱,集中展示当前平台整体资源利用率与异常概况,帮助运维管理员快速评估系统健康度,并决定是否需要进入集群、节点、设备或作业等专项监控页面深入定位。
术语表
| 术语 | 说明 |
|---|---|
| 全局水位 | 平台整体的显卡、CPU、内存及磁盘等资源使用率。 |
| 异常聚合 | 集中统计当前集群、节点及作业的异常或失败数量。 |
| 专项监控 | 左侧导航中的集群统计、节点统计、设备监控与作业监控子页面。 |
推荐操作顺序
先读取顶部集群、节点与作业的整体健康状态,再核对显卡、CPU、内存及磁盘的资源使用水位;若发现异常,通过左侧导航切换到对应的专项监控页面深入排查。
小白先看
这是只读的全局状态看板,不是资源配置页面。页面用于宏观判断健康度与资源瓶颈方向,具体故障排查需通过左侧菜单进入具体对象页面核实。
前提条件
- 当前账号具备运营管理员监控查看权限。
- 目标地域、可用区和集群已完成资源接入。
- 监控采集组件正常上报集群、节点、设备和作业数据。
- 已明确需要关注的资源池与受影响资源类型。
页面说明
页面用于了解当前 On-Prem 资源状态,并判断下一步应进入哪个专项监控页面继续排查。

统计概览集中展示全局资源状态、作业分布及硬件利用率看板。建议按以下顺序阅读页面:
| 页面区域 | 需要确认的内容 |
|---|---|
| 集群状态 | 集群总数,以及正常和异常集群的数量分布。 |
| 节点状态 | 物理/计算节点总数,以及正常和异常节点的数量分布。 |
| 作业分布 | 在线 IDE 与运行实例的分布柱状图,以及运行中、已完成、失败、暂停、终止的作业占比环形图。 |
| 显卡信息 | GPU 规格名称(如 nvidia.com/gpu)、总卡数、未使用卡数、已使用卡数及使用总量百分比仪表盘。 |
| 计算与存储信息 | CPU、内存和磁盘的使用率仪表盘,以及各自的总量、已使用量与剩余量。 |
| 专项导航入口 | 左侧菜单中的集群统计、节点统计、设备监控与作业监控入口。 |
主要操作
阅读总览并识别资源水位
- 进入
AI基础设施 > On-Prem > 监控 > 统计概览。 - 检查顶部的【集群状态】与【节点状态】卡片,确认是否存在标红的异常对象数量。
- 查看【作业分布】卡片,确认是否存在处于“失败”或非预期“终止”状态的作业占比。
- 查看下方的【显卡信息】、【CPU信息】、【内存信息】及【磁盘信息】,核对仪表盘使用率百分比及已使用/剩余容量数值。
- 当使用率处于黄色(中度)或红色(高危)区间时,预估平台容量风险。
根据异常指标进入专项监控排查
- 集群异常:若【集群状态】中出现异常集群,点击左侧导航菜单的 【集群统计】,定位故障集群名称与事件。
- 节点异常:若【节点状态】中出现异常节点,点击左侧导航菜单的 【节点统计】,查看具体离线或未就绪的物理机节点。
- 算力紧张:若【显卡信息】使用总量偏高(如超过 85%),点击左侧导航菜单的 【设备监控】,排查每张 GPU 卡的显存占用与算力分配。
- 作业故障:若【作业分布】中失败作业增多,点击左侧导航菜单的 【作业监控】,查找异常退出的作业实例与日志报错。
- 对外分享监控截图前,遮挡内部资源名称和敏感标识。
参数速查表
| 字段/指标名称 | 是否必填 | 字段类型 | 示例 | 说明 |
|---|---|---|---|---|
| 集群状态(总数/正常/异常) | 系统生成 | 状态统计 | 总数: 1个 / 1个正常 / 0个异常 | 展示当前平台纳入监控的集群总数及健康/异常数量。 |
| 节点状态(总数/正常/异常) | 系统生成 | 状态统计 | 总数: 2个 / 2个正常 / 0个异常 | 展示计算节点总数,绿色为正常就绪,红色为异常。 |
| 作业分布(分类柱状) | 系统生成 | 分布图表 | 在线IDE: 1 / 运行实例: 1 | 分类展示在线开发环境与推理/训练运行实例的任务数量。 |
| 作业状态(状态环形) | 系统生成 | 占比图表 | 运行中 / 已完成 / 失败 / 暂停 / 终止 | 汇总统计当前所有作业在各生命周期状态下的份额与百分比。 |
| 显卡信息 | 系统生成 | 资源容量 | 总量: 16 AI card(s) / 未使用: 16 / 已使用: 0 | 展示 GPU 驱动型号标识及 AI 卡的总数、空闲与占用情况。 |
| 显卡使用总量 | 系统生成 | 百分比仪表盘 | 0% | 全局 GPU 算力资源的总使用率。 |
| CPU信息 | 系统生成 | 资源容量 | 总量: 160 vCPU / 已使用: 29 / 剩余: 131 | 展示平台总 vCPU 核心数、占用核心数及剩余可用核心数。 |
| CPU使用率 | 系统生成 | 半圆仪表盘 | 18.13%(低/中/高) | 全局 CPU 算力负载率,带低、中、高区间指示。 |
| 内存信息 | 系统生成 | 资源容量 | 总量: 502.47 GB / 已使用: 56.84 / 剩余: 445.64 | 展示系统内存的物理总容量、已分配内存及剩余内存。 |
| 内存使用率 | 系统生成 | 半圆仪表盘 | 11.31%(低/中/高) | 全局内存资源使用百分比。 |
| 磁盘信息 | 系统生成 | 资源容量 | 总量: 877.1 GB / 已使用: 20 / 剩余: 857.1 | 展示本地或挂载磁盘存储的总容量、已占用及剩余空间。 |
| 磁盘使用率 | 系统生成 | 半圆仪表盘 | 2.28%(低/中/高) | 平台磁盘存储空间的占用比例。 |
踩坑提示
- 总览只能帮助定位方向,不能替代具体对象详情。
- 水位升高要结合新增作业、扩容和排队情况判断。
- 统计概览用于观察全局水位,不应单独作为扩容、迁移或故障判断的唯一依据。
- 指标可能存在采集延迟,异常排查需结合集群、节点、设备和作业详情。
- 截图前遮挡租户、节点名和业务标识。
- 不在文档中写真实集群 ID、节点名、资源池 ID、租户信息、内部指标 key 或测试数据。
判读规则与影响
- 总览用于先判方向:先确认异常指标类型,再通过左侧菜单进入对应的集群、节点或作业专项监控页面。
- 异常数量要结合周期观察:排障时应确认异常是瞬时波动还是持续故障,避免因瞬时抖动误判。
- 指标状态决定可信度:卡片数值明显异常或无数据时,先核对监控采集链路是否正常。
- 水位变化要看整体:瞬时高水位不一定是故障,应结合新增作业、扩容、维护窗口和历史趋势综合判断。
结果校验
| 检查项 | 成功表现 | 异常时处理 |
|---|---|---|
| 页面加载 | 统计概览 6 大指标图表与卡片正常显示 | 检查当前角色的监控权限以及底层监控采集服务状态 |
| 状态核对 | 集群与节点正常/异常数符合实际纳管规模 | 刷新页面复查,若数量不符核对接入管理中的集群纳管状态 |
| 数据新鲜度 | 资源使用率及作业数随实际作业运行动态刷新 | 到系统设置或监控采集组件核对采集周期、连接和告警 |
| 异常排查流转 | 发现异常指标时可顺畅切换至左侧对应监控页面 | 检查对应子页面菜单权限与可见范围 |
常见问题
统计概览没有数据
问题现象:
页面可进入,但图表或状态卡片显示为空或全为 0。
可能原因:
- 监控采集组件未启动或网络中断。
- 当前角色无监控指标查看权限。
- 底层集群尚未接入监控上报。
处理方式:
- 检查底层 Prometheus/监控采集 Agent 服务运行状态。
- 确认当前登录角色具备 On-Prem 监控运维权限。
- 到【集群管理】页面确认集群是否处于健康纳管状态。
统计概览数据长时间未更新
问题现象:
作业已提交或已结束,但概览中的使用率和作业状态长时间没有变化。
可能原因:
- 采集周期存在定时拉取间隔。
- 浏览器页面缓存未刷新。
- 监控指标上报链路阻塞。
处理方式:
- 刷新浏览器页面或重新进入概览。
- 检查监控服务容器与采集日志。
- 切换至【作业监控】核对具体作业的实时状态。
统计概览与子监控页面数值不一致
问题现象:
概览卡片上的节点或作业数量与子页面列表展示的行数存在差异。
可能原因:
- 统计概览与明细列表的聚合缓存刷新频率不同。
- 子页面应用了额外的筛选条件。
处理方式:
- 检查子页面是否包含项目、状态或名称筛选。
- 清除子页面的临时筛选条件后重新对照。
无法在专项监控中找到概览对应的异常对象
问题现象:
概览提示有 1 个异常节点或失败作业,但进入对应子页面列表未直接看到。
可能原因:
- 目标对象已自动恢复或已被清理释放。
- 列表默认只展示部分状态,需调整状态筛选。
处理方式:
- 在【节点统计】或【作业监控】中将状态筛选切换为“全部”或“异常/失败”。
- 检查最近的操作审计日志与集群事件。
异常峰值无法复现
问题现象:
监控仪表盘此前记录了高水位,但当前已恢复正常。
可能原因:
- 属于瞬时突发流量或短任务引发的峰值。
- 任务已正常结束并释放了显卡算力。
处理方式:
- 到【作业监控】中筛选该时间段内运行的历史作业。
- 对照作业运行时长与资源配额。
注意事项
- 总览用于发现方向,不作为事故定责唯一依据。
- 截图前遮挡租户、节点、IP 和业务标识。
- 水位异常需要结合历史趋势、业务窗口和作业变化判断。
- 扩容、迁移或故障处理前,需要结合集群统计、节点统计、设备监控和作业监控交叉确认。
- 文档示例不得包含真实集群 ID、节点名、资源池 ID、租户信息、内部指标 key 或测试数据。
后续操作
- 异常集中在集群时,点击左侧菜单进入 【集群统计】。
- 异常集中在节点或硬件时,点击左侧菜单进入 【节点统计】 或 【设备监控】。
- 作业失败或排队升高时,点击左侧菜单进入 【作业监控】 并结合配额排查。