纳管算力节点部署配置要求
前言
| 项目 | 内容 |
|---|---|
| 适用角色 | 算力资源规划人员、实施工程师、客户基础设施管理员 |
| 导航路径 | 部署 > 纳管算力节点部署配置要求 |
| 功能定位 | 在算力节点安装前,帮助用户完成环境调研、加速卡兼容性确认、资源规格、端口和网络规划 |
本文回答的是“这些算力节点是否已经具备纳管条件”。如果只需要安装命令,也建议先完成本文检查,再阅读 纳管节点快速部署。
新手理解
这篇文档是 GPU / NPU 节点的准备清单。它帮助你在 Kubernetes 安装前确认硬件、驱动、操作系统、网络、端口和历史环境清理授权。
准备时间线
| 阶段 | 你要做什么 | 完成标志 |
|---|---|---|
| 第 1 步:环境调研 | 收集每台节点的硬件、系统、驱动、网络和存储信息 | 调研表填写完整 |
| 第 2 步:兼容性确认 | 确认 GPU / NPU 型号、CPU 架构和操作系统支持情况 | 加速卡和操作系统组合可部署 |
| 第 3 步:资源规划 | 确认 Master、etcd、Worker 节点数量和规格 | 节点角色和规格清单已确认 |
| 第 4 步:网络与端口规划 | 放通 Kubernetes API、Harbor、AGIOne 访问和监控端口 | 防火墙 / 安全组规则已准备 |
| 第 5 步:进入部署 | 准备安装包并按快速部署文档安装集群 | 可开始算力集群部署 |
术语速查
| 术语 | 说明 |
|---|---|
| Master 节点 | Kubernetes 控制平面节点,负责调度和管理集群 |
| Worker 节点 | 真正运行模型推理或训练负载的 GPU / NPU 节点 |
| etcd | Kubernetes 使用的元数据存储,用于保存集群状态 |
| device-plugin | 将 GPU / NPU 资源注册给 Kubernetes 调度器的插件 |
| RDMA | 高性能网络能力,常用于多机训练或张量并行 |
| OFED | Mellanox 网卡驱动套件,常用于 RDMA 场景 |
| Harbor | 容器镜像仓库 |
| NodePort | Kubernetes 对外暴露服务端口的一种方式 |
1 环境调研
1.1 节点环境调研表
在正式部署前,必须对每一台待纳管节点完成环境信息收集,使用项目随附的 AGIOne纳管节点环境调研表.xlsx 模板逐项填写。调研内容分为硬件环境与系统环境两大类。
1.1.1 硬件环境调研项
| 类别 | 关键项 | 示例 / 填写说明 | 备注 |
|---|---|---|---|
| 硬件环境 | CPU | 64 核, x86_64 | 核心数与架构 |
| 硬件环境 | 内存 | 256 GB | 总内存容量 |
| 硬件环境 | 加速卡厂商 | 英伟达 / 华为昇腾 / 燧原 / 壁仞 | 用于确定 device-plugin 类型 |
| 硬件环境 | 加速卡配置 | 8 × A800, 80 GB 显存 | 卡数 + 单卡型号 + 显存 |
| 硬件环境 | 加速卡间网络连接 | PCIe / NVLink | 影响多卡张量并行性能 |
| 硬件环境 | 基础存储(系统盘) | 500 GB | 不少于 100 GB,生产建议 200 GB |
| 硬件环境 | 数据存储 | 1 × 3 TB NVMe SSD | 用于模型权重与容器数据 |
| 硬件环境 | 管理网络带宽 | 1000 Mbps | 节点间管理网 ≥ 100 Mbps |
| 硬件环境 | 是否可访问外网 | 是 / 否 | 推荐为"是",便于驱动与依赖在线获取 |
| 硬件环境 | 是否配置 RDMA | 是 / 否 | 多机张量并行场景必备 |
| 硬件环境 | RDMA 网络类型 | RoCE / IB | 影响 SR-IOV 与组件配置 |
| 硬件环境 | RDMA 网络带宽 | 100 Gbps | InfiniBand 推荐 200 Gbps+ |
1.1.2 系统环境调研项
| 类别 | 关键项 | 示例 / 填写说明 | 备注 |
|---|---|---|---|
| 系统环境 | 操作系统 | CentOS 7 / Ubuntu 20.04 / Ubuntu 22.04 / OpenEuler 22.03 LTS | Arm64 架构不支持 Ubuntu 22.04 |
| 系统环境 | 是否安装加速卡驱动 | 是 / 否 | 必须安装到位 |
| 系统环境 | 加速卡驱动版本 | NVIDIA 570 / CANN 8.x | 版本需与卡型号匹配 |
| 系统环境 | 是否安装 RDMA 网卡驱动 | 是 / 否 | RDMA 场景必装 |
| 系统环境 | RDMA 网卡驱动版本 | MLNX_OFED-23.07-0.5.1.2 | 推荐 23.07 及以上 |
| 系统环境 | 是否已安装 Docker | 是 / 否 | 若已安装,需确认是否可清理 |
| 系统环境 | 是否已安装 Kubernetes | 是 / 否 | 若已安装,需确认是否可清理 |
重要提示:若 Worker 节点已存在 Docker 或 Kubernetes 环境,须在客户授权下进行清理后再部署 AGIOne 集群组件,以避免端口冲突、容器运行时混乱、网络插件冲突等问题。
1.2 调研产出物
环境调研阶段须输出以下文件,作为后续部署的输入:
- 已填写完整的《AGIOne 纳管节点环境调研表》(每节点一份,或合并表格)
- 节点 IP 与主机名列表(含 Master、etcd、Worker 角色规划)
- 网络拓扑图(含管理网、业务网、RDMA 网,以及防火墙规则说明)
- 客户清理已有 Docker/Kubernetes 环境的授权确认书(如适用)
2 芯片兼容性确认
2.1 已支持芯片清单
AGIOne 平台当前已完成兼容性验证的加速卡型号涵盖英伟达、华为昇腾、燧原、壁仞四大厂商,明细如下:
2.1.1 NVIDIA GPU
| 架构 / 系列 | 型号 |
|---|---|
| Hopper | H800、H200、H100、H20 |
| Ampere | A100、A800、A40、A30、A10、RTX A6000、RTX A5000、RTX A4000、RTX A2000、RTX 3090、RTX 3060 |
| Ada | L40、L40S、L20、L20S、L4、L2、RTX 6000、RTX 5000、RTX 4500、RTX 4000、RTX 2000、RTX 4090、RTX 4090D |
2.1.2 华为昇腾
| 架构 / 系列 | 型号 |
|---|---|
| Ascend 910 | Ascend 910B、Ascend 910C |
2.1.3 其他国产芯片
| 厂商 | 架构 / 系列 | 型号 |
|---|---|---|
| 燧原(Enflame) | Enflame | S60 |
| 壁仞(Biren) | Biren | 106 |
2.2 兼容性核对要点
- 节点搭载芯片必须严格出现在上述清单中。如遇清单外型号,须提交 AGIOne 平台团队进行专项兼容性评估,评估周期通常 2 ~ 4 周。
- 同一个 Kubernetes 集群内,强烈建议 Worker 节点 CPU 架构保持一致(全部 x86_64 或全部 arm64),不同架构请独立组建集群。
- 同一集群内可混合不同型号的 NVIDIA 卡(如 H20 + A10),但混合不同厂商的加速卡(如 NVIDIA + Ascend)不推荐,因 device-plugin 与监控组件无法在同一节点共存。
3 硬件与节点资源规格
3.1 管理节点(Management Nodes)
管理节点承载 AGIOne 核心服务、数据库、中间件及 Kubernetes 控制平面组件,不需要 GPU/NPU。生产环境建议至少 3 台管理节点以保障高可用。
3.1.1 基础规格要求
| 项目 | 最低要求 | 生产推荐 |
|---|---|---|
| CPU 核数 | ≥ 4 核 | ≥ 16 核 |
| 内存 | ≥ 8 GB | ≥ 16 GB |
| 系统盘 | ≥ 100 GB | ≥ 200 GB |
| 数据盘 | 可选 ≥ 500 GB | ≥ 400 GB(可使用 NAS 盘) |
| 节点数量 | ≥ 1 | ≥ 3 |
| 共享存储 | — | ≥ 1024 GB(块盘或 NAS) |
3.1.2 按集群规模的差异化配置
管理节点资源应根据待纳管 Worker 节点规模进行扩展,以下规格为生产环境单节点最低要求,每种规模均建议至少 3 台管理节点:
| 待管理节点规模 | Kubernetes 基础需求 | AGIOne 服务额外需求 | 单节点合计 | 最少节点数 |
|---|---|---|---|---|
| 1 ~ 5 节点 | 1C 4G | 7C 12G | 8C 16G | 3 |
| 6 ~ 10 节点 | 2C 8G | 7C 12G | 9C 20G | 3 |
| 11 ~ 100 节点 | 4C 16G | 12C 24G | 16C 40G | 3 |
| 101 ~ 250 节点 | 8C 32G | 12C 24G | 20C 56G | 3 |
| 251 ~ 500 节点 | 16C 64G | 24C 48G | 40C 112G | 3 |
| 500+ 节点 | 32C 128G | 32C 64G | 64C 192G | 3 |
建议:单集群管理 Worker 节点不超过 1000 台。超过该规模请采用多集群联邦方案,由 AGIOne 管控平面统一纳管。
3.2 Worker 节点(NPU/GPU 节点)
Worker 节点承载实际推理负载,至少配置 1 张加速卡。
3.2.1 基础规格要求
| 项目 | 最低要求 | 生产推荐 |
|---|---|---|
| CPU 核数 | ≥ 8 核 | ≥ 16 核(预留给 K8s 与系统进程) |
| 内存 | ≥ 16 GB | ≥ 16 GB 预留 + 模型推理实际所需 |
| 系统盘 | ≥ 100 GB | ≥ 200 GB |
| 数据盘 | ≥ 500 GB(必须) | ≥ 2 TB(用于模型权重与容器卷) |
| 加速卡 | ≥ 1 张 | 按业务规模配置 8 ~ 16 张 |
| 共享存储 | — | ≥ 2048 GB(NAS / IPFS 等) |
| 网络 | 与管理节点全通 | 管理网 + RDMA 网(多机张量并行) |
| 外部互联网 | 必须可访问 | 用于驱动、依赖、模型下载 |
3.2.2 操作系统支持矩阵
| CPU 架构 | 支持的操作系统 |
|---|---|
| x86_64 | Ubuntu 20.04、Ubuntu 22.04、CentOS 7 |
| arm64 | Ubuntu 20.04、CentOS 7、OpenEuler 22.03 LTS |
同一 Kubernetes 集群内,所有 Master、etcd、Worker 节点的 CPU 架构必须保持一致。
3.3 端口需求
Worker 节点须开放以下端口给管理节点访问:
| 端口 | 协议 | 用途 |
|---|---|---|
| 6443 | TCP | Kubernetes API Server |
| 8090 | TCP | Harbor 镜像仓库 |
| 32761 | TCP | AGIOne 业务接入 |
| 32762 | TCP | AGIOne 业务接入 |
| 32763 | TCP | AGIOne 业务接入 |
| 32764 | TCP | AGIOne 业务接入 |
| 32765 | TCP | Grafana 监控面板(默认) |
集群默认 NodePort 端口区间为 30000 ~ 32767,可在安装时通过 --port-range 参数调整。