Skip to content

场景概览 - 异构卡纳管:算力接入 ​

本场景介绍如何把本地 Kubernetes 集群及其中的 GPU、NPU、XPU 接入 AGIOne,并把硬件能力转换为可调度的资源规格。对于“我有 4 张 NPU 卡,如何管理?”这一任务,本场景负责完成卡型识别、集群接入和规格规划。

适用角色 ​

  • 运营管理员
  • 集群运维人员

场景目标 ​

  • 平台能够识别目标 NPU 型号和资源 key。
  • 集群节点能够上报全部 4 张 NPU 卡。
  • 用户可以选择 1 卡、2 卡或 4 卡资源规格。

场景流程 ​

主线: 创建地域与可用区 → 识别 NPU 卡型 → 接入集群并发现设备 → 建立 1/2/4 卡规格 → 验证下游可选择

阶段核心结果
1. 建立资源边界地域和可用区可供目标集群选择
2. 识别卡型NPU 型号、单卡显存和调度资源 key 口径统一
3. 接入集群集群和节点可用,4 张物理 NPU 卡全部被发现
4. 建立规格1 卡、2 卡和 4 卡方案与实际调度拓扑匹配
5. 验证下游推理模板或测试作业能够选择并申请目标规格

开始前准备 ​

  • 已准备 Kubernetes 集群连接信息和目标地域、可用区。
  • 已确认 NPU 厂商、型号、单卡显存及设备插件上报的资源 key。
  • 已确认 4 张卡位于哪些节点,以及是否允许跨节点调度。

推荐阅读顺序 ​

  1. 创建地域与可用区
  2. 维护加速卡型号
  3. 接入集群并核对设备
  4. 配置规格指标与资源规格
  5. 构建推理模板
  6. 配置配额并监控资源

文档索引 ​

文档说明
创建地域与可用区建立集群、规格、镜像和存储共同使用的资源边界
维护加速卡型号确认 NPU 型号、显存、适配状态和 Kubernetes 资源 key
接入集群并核对设备注册集群,确认节点和 4 张 NPU 卡全部上报
配置规格指标与资源规格建立调度指标,并规划 1 卡、2 卡、4 卡规格
地域/可用区从异构资源纳管的首个运营页面开始查看

完成检查 ​

用途: 以下检查是本场景的退出条件,用于判断是否已经取得可观察、可复核的结果,以及是否可以进入下一场景。它不是操作步骤的重复;任一项不满足时,请返回对应功能文档的“常见失败分支”排查。

检查项通过标准
1地域和可用区已建立,并可供集群注册选择。
2集群状态可用,节点状态正常。
3平台识别到 4 张目标 NPU 卡。
4资源规格能够被推理模板或测试作业选择。

相关场景 ​