Skip to content

统计概览 ​

功能概述 ​

项目内容
适用角色运营管理员
导航路径AI基础设施 > On-Prem > 监控 > 统计概览
页面路由/powerone/monitor/overview
管理对象资源池总览、集群数量、节点状态、作业分布和资源容量

新手理解 ​

统计概览像资源池驾驶舱,集中展示当前平台整体资源利用率与异常概况,帮助运维管理员快速评估系统健康度,并决定是否需要进入集群、节点、设备或作业等专项监控页面深入定位。

术语表 ​

术语说明
全局水位平台整体的显卡、CPU、内存及磁盘等资源使用率。
异常聚合集中统计当前集群、节点及作业的异常或失败数量。
专项监控左侧导航中的集群统计、节点统计、设备监控与作业监控子页面。

推荐操作顺序 ​

先读取顶部集群、节点与作业的整体健康状态,再核对显卡、CPU、内存及磁盘的资源使用水位;若发现异常,通过左侧导航切换到对应的专项监控页面深入排查。

小白先看 ​

这是只读的全局状态看板,不是资源配置页面。页面用于宏观判断健康度与资源瓶颈方向,具体故障排查需通过左侧菜单进入具体对象页面核实。

前提条件 ​

  1. 当前账号具备运营管理员监控查看权限。
  2. 目标地域、可用区和集群已完成资源接入。
  3. 监控采集组件正常上报集群、节点、设备和作业数据。
  4. 已明确需要关注的资源池与受影响资源类型。

页面说明 ​

页面用于了解当前 On-Prem 资源状态,并判断下一步应进入哪个专项监控页面继续排查。

统计概览

统计概览集中展示全局资源状态、作业分布及硬件利用率看板。建议按以下顺序阅读页面:

页面区域需要确认的内容
集群状态集群总数,以及正常和异常集群的数量分布。
节点状态物理/计算节点总数,以及正常和异常节点的数量分布。
作业分布在线 IDE 与运行实例的分布柱状图,以及运行中、已完成、失败、暂停、终止的作业占比环形图。
显卡信息GPU 规格名称(如 nvidia.com/gpu)、总卡数、未使用卡数、已使用卡数及使用总量百分比仪表盘。
计算与存储信息CPU、内存和磁盘的使用率仪表盘,以及各自的总量、已使用量与剩余量。
专项导航入口左侧菜单中的集群统计、节点统计、设备监控与作业监控入口。

主要操作 ​

阅读总览并识别资源水位 ​

  1. 进入 AI基础设施 > On-Prem > 监控 > 统计概览。
  2. 检查顶部的【集群状态】与【节点状态】卡片,确认是否存在标红的异常对象数量。
  3. 查看【作业分布】卡片,确认是否存在处于“失败”或非预期“终止”状态的作业占比。
  4. 查看下方的【显卡信息】、【CPU信息】、【内存信息】及【磁盘信息】,核对仪表盘使用率百分比及已使用/剩余容量数值。
  5. 当使用率处于黄色(中度)或红色(高危)区间时,预估平台容量风险。

根据异常指标进入专项监控排查 ​

  1. 集群异常:若【集群状态】中出现异常集群,点击左侧导航菜单的 【集群统计】,定位故障集群名称与事件。
  2. 节点异常:若【节点状态】中出现异常节点,点击左侧导航菜单的 【节点统计】,查看具体离线或未就绪的物理机节点。
  3. 算力紧张:若【显卡信息】使用总量偏高(如超过 85%),点击左侧导航菜单的 【设备监控】,排查每张 GPU 卡的显存占用与算力分配。
  4. 作业故障:若【作业分布】中失败作业增多,点击左侧导航菜单的 【作业监控】,查找异常退出的作业实例与日志报错。
  5. 对外分享监控截图前,遮挡内部资源名称和敏感标识。

参数速查表 ​

字段/指标名称是否必填字段类型示例说明
集群状态(总数/正常/异常)系统生成状态统计总数: 1个 / 1个正常 / 0个异常展示当前平台纳入监控的集群总数及健康/异常数量。
节点状态(总数/正常/异常)系统生成状态统计总数: 2个 / 2个正常 / 0个异常展示计算节点总数,绿色为正常就绪,红色为异常。
作业分布(分类柱状)系统生成分布图表在线IDE: 1 / 运行实例: 1分类展示在线开发环境与推理/训练运行实例的任务数量。
作业状态(状态环形)系统生成占比图表运行中 / 已完成 / 失败 / 暂停 / 终止汇总统计当前所有作业在各生命周期状态下的份额与百分比。
显卡信息系统生成资源容量总量: 16 AI card(s) / 未使用: 16 / 已使用: 0展示 GPU 驱动型号标识及 AI 卡的总数、空闲与占用情况。
显卡使用总量系统生成百分比仪表盘0%全局 GPU 算力资源的总使用率。
CPU信息系统生成资源容量总量: 160 vCPU / 已使用: 29 / 剩余: 131展示平台总 vCPU 核心数、占用核心数及剩余可用核心数。
CPU使用率系统生成半圆仪表盘18.13%(低/中/高)全局 CPU 算力负载率,带低、中、高区间指示。
内存信息系统生成资源容量总量: 502.47 GB / 已使用: 56.84 / 剩余: 445.64展示系统内存的物理总容量、已分配内存及剩余内存。
内存使用率系统生成半圆仪表盘11.31%(低/中/高)全局内存资源使用百分比。
磁盘信息系统生成资源容量总量: 877.1 GB / 已使用: 20 / 剩余: 857.1展示本地或挂载磁盘存储的总容量、已占用及剩余空间。
磁盘使用率系统生成半圆仪表盘2.28%(低/中/高)平台磁盘存储空间的占用比例。

踩坑提示 ​

  • 总览只能帮助定位方向,不能替代具体对象详情。
  • 水位升高要结合新增作业、扩容和排队情况判断。
  • 统计概览用于观察全局水位,不应单独作为扩容、迁移或故障判断的唯一依据。
  • 指标可能存在采集延迟,异常排查需结合集群、节点、设备和作业详情。
  • 截图前遮挡租户、节点名和业务标识。
  • 不在文档中写真实集群 ID、节点名、资源池 ID、租户信息、内部指标 key 或测试数据。

判读规则与影响 ​

  • 总览用于先判方向:先确认异常指标类型,再通过左侧菜单进入对应的集群、节点或作业专项监控页面。
  • 异常数量要结合周期观察:排障时应确认异常是瞬时波动还是持续故障,避免因瞬时抖动误判。
  • 指标状态决定可信度:卡片数值明显异常或无数据时,先核对监控采集链路是否正常。
  • 水位变化要看整体:瞬时高水位不一定是故障,应结合新增作业、扩容、维护窗口和历史趋势综合判断。

结果校验 ​

检查项成功表现异常时处理
页面加载统计概览 6 大指标图表与卡片正常显示检查当前角色的监控权限以及底层监控采集服务状态
状态核对集群与节点正常/异常数符合实际纳管规模刷新页面复查,若数量不符核对接入管理中的集群纳管状态
数据新鲜度资源使用率及作业数随实际作业运行动态刷新到系统设置或监控采集组件核对采集周期、连接和告警
异常排查流转发现异常指标时可顺畅切换至左侧对应监控页面检查对应子页面菜单权限与可见范围

常见问题 ​

统计概览没有数据 ​

问题现象:

页面可进入,但图表或状态卡片显示为空或全为 0。

可能原因:

  • 监控采集组件未启动或网络中断。
  • 当前角色无监控指标查看权限。
  • 底层集群尚未接入监控上报。

处理方式:

  1. 检查底层 Prometheus/监控采集 Agent 服务运行状态。
  2. 确认当前登录角色具备 On-Prem 监控运维权限。
  3. 到【集群管理】页面确认集群是否处于健康纳管状态。

统计概览数据长时间未更新 ​

问题现象:

作业已提交或已结束,但概览中的使用率和作业状态长时间没有变化。

可能原因:

  • 采集周期存在定时拉取间隔。
  • 浏览器页面缓存未刷新。
  • 监控指标上报链路阻塞。

处理方式:

  1. 刷新浏览器页面或重新进入概览。
  2. 检查监控服务容器与采集日志。
  3. 切换至【作业监控】核对具体作业的实时状态。

统计概览与子监控页面数值不一致 ​

问题现象:

概览卡片上的节点或作业数量与子页面列表展示的行数存在差异。

可能原因:

  • 统计概览与明细列表的聚合缓存刷新频率不同。
  • 子页面应用了额外的筛选条件。

处理方式:

  1. 检查子页面是否包含项目、状态或名称筛选。
  2. 清除子页面的临时筛选条件后重新对照。

无法在专项监控中找到概览对应的异常对象 ​

问题现象:

概览提示有 1 个异常节点或失败作业,但进入对应子页面列表未直接看到。

可能原因:

  • 目标对象已自动恢复或已被清理释放。
  • 列表默认只展示部分状态,需调整状态筛选。

处理方式:

  1. 在【节点统计】或【作业监控】中将状态筛选切换为“全部”或“异常/失败”。
  2. 检查最近的操作审计日志与集群事件。

异常峰值无法复现 ​

问题现象:

监控仪表盘此前记录了高水位,但当前已恢复正常。

可能原因:

  • 属于瞬时突发流量或短任务引发的峰值。
  • 任务已正常结束并释放了显卡算力。

处理方式:

  1. 到【作业监控】中筛选该时间段内运行的历史作业。
  2. 对照作业运行时长与资源配额。

注意事项 ​

  • 总览用于发现方向,不作为事故定责唯一依据。
  • 截图前遮挡租户、节点、IP 和业务标识。
  • 水位异常需要结合历史趋势、业务窗口和作业变化判断。
  • 扩容、迁移或故障处理前,需要结合集群统计、节点统计、设备监控和作业监控交叉确认。
  • 文档示例不得包含真实集群 ID、节点名、资源池 ID、租户信息、内部指标 key 或测试数据。

后续操作 ​

  1. 异常集中在集群时,点击左侧菜单进入 【集群统计】。
  2. 异常集中在节点或硬件时,点击左侧菜单进入 【节点统计】 或 【设备监控】。
  3. 作业失败或排队升高时,点击左侧菜单进入 【作业监控】 并结合配额排查。