Skip to content

可观测与问题排查 ​

本场景指导运营方、模型提供方和调用方先判断问题属于调用、模型服务、云上部署、异构卡纳管资源还是计量,再进入对应日志和监控页面,避免在错误子系统中反复搜索。

适用角色 ​

  • 在各自权限范围排查问题的平台用户、模型提供方和平台运营方

场景目标 ​

  • 问题具备角色、时间范围、模型或资源编号和可复现现象。
  • 能把问题定位到调用、部署、作业、节点、设备或计量层。
  • 日志、事件、监控和用量数据使用相同时间范围进行关联。
  • 排障材料脱敏且足以交接给下一责任方。

开始前准备 ​

  1. 记录发生时间、账号角色、租户、子系统和操作入口。
  2. 记录脱敏后的模型、部署、实例、作业或请求标识。
  3. 区分“不可见、创建失败、运行失败、调用失败、性能下降、用量异常”。
  4. 不在工单或群聊中发送完整 Prompt、响应、Token、密钥或内部 接口地址。

问题分流 ​

现象首要入口参考手册
模型 API 调用失败或响应异常我的调用 / 客户调用日志调用日志、客户调用日志
调用成功率、时延或 Token 异常调用分析我的调用分析、客户调用分析
云上部署失败或不可访问我的部署详情、事件和监控我的部署
异构卡纳管作业排队或失败作业监控、实例事件和日志作业监控、模型实例
节点或加速卡异常节点统计、设备监控节点统计、设备监控
配额、用量或金额异常配额、计量明细和模型用量异构卡纳管:资源计量与监控、模型的消费与收益

通用排查顺序 ​

  1. 复现并记录第一条错误,不要只记录最后的连锁错误。
  2. 确认账号、租户、地域、模型和时间筛选正确。
  3. 从用户可见状态进入事件和日志,再进入节点或设备监控。
  4. 对调用问题同时核对请求日志和模型服务状态。
  5. 对资源问题同时核对作业状态、节点容量和设备健康。
  6. 对用量问题先核对真实运行记录,再核对计量明细和账期汇总。

判断故障层级时,使用 异构卡纳管监控概览在同一时间范围内对比集群、节点、设备和作业信号。

在同一时间范围内对比监控信号

完成检查 ​

用途: 以下检查是当前功能任务的退出条件,用于判断操作结果是否可观察、可复核,以及是否可以继续当前场景的下一步。它不是操作步骤的重复;任一项不满足时,请按下方“常见失败分支”继续排查。

检查项通过标准
1已明确问题层级和当前责任方。
2错误时间与日志、事件、监控时间一致。
3已确认是否影响单个请求、单个实例、单个租户或整个平台。
4修复或规避后已用相同条件重新验证。
5交接材料包含入口、步骤、期望、实际、时间和脱敏证据。

常见失败分支与误区 ​

  • 只看汇总监控,不查看失败事件或请求日志。
  • 时间范围、地域或租户筛选不一致,导致数据无法对应。
  • 把权限不可见误判为资源不存在。
  • 把配额不足、账户额度不足和集群容量不足混为一类问题。
  • 复制完整请求或凭据作为排障材料。