算力资源与调度
芯片与集群规模
问:对昇腾芯片的管理调度能力如何?涵盖哪些型号?已落地的最大项目规模多大?是否有明确的适配路线图?
答:支持华为昇腾 Ascend 910 系列中的 910B / 910C,并适配 vLLM-Ascend / MindIE;有规划适配Ascend 950和超节点。
问:是否有超节点相关计划?支持哪些超节点管理调度能力?
答:有(需协调资源)。
问:支持的最大集群规模(卡数)是多少?月级长稳调度的保障能力如何?
答:单集群120卡(非极限,既可在集群内扩节点,也可新建集群纳管)。AGIOne主要针对推理场景,至少 3 管理节点 HA、故障自愈、资源充足时自动在新节点拉起模型、失败自动回滚资源、健康检查、硬件30 秒粒度监控、调度层 1 分钟粒度监控,以及调用链路可观测。
资源规格与资源池
问:是否支持CPU、GPU、NPU等多种异构资源规格?能否让AI开发者无需运维底层物理资源?
答:支持异构 GPU / NPU 统一管理,并由管理员统一配置资源规格,包括 NVIDIA Hopper / Ada / Ampere,以及 Ascend 910B / 910C等。可让AI开发者无需运维底层物理资源。
问:是否支持逻辑分区?资源切分的最小粒度是多少?
答:可支持逻辑层面的资源分区和权限隔离。资源切分的最小粒度是独立单卡(不支持动态MIG或显卡切分)。
问:是否提供专属资源池,支持用户使用独享的计算资源运行训练作业?
答:支持为指定租户提供专属资源池。
多租户与调度
问:是否支持多租户资源隔离?多租户隔离的架构是怎样的?如何保证数据隐私和安全,避免越权访问和资源抢占?
答:支持多租户资源隔离。租户拥有独立的namespace,通过networkpolicy进行网络隔离。用户资源通过租户进行逻辑隔离。
问:是否具备理解AI运行特点的智能作业调度策略?支持哪些调度方式?能否对异常、失败作业进行实时监控和处理?
答:支持策略包括:1、资源匹配策略,如显卡型号、RDMA网络匹配策略;2、亲和匹配、均衡分配/紧凑分配。可以监控异常、失败作业作业,对于推理任务,可配置失败自动恢复(资源充足时)。
问:GPU 管理和调度如何实现?
答:GPU/NPU 节点通过 Kubernetes 和 Kubernetes device plugin 进行管理。不同类型的 GPU/NPU 卡可以设置标签,并根据标签和资源配额要求进行调度。
问:自助部署过程中,资源治理由谁管理?如何管理?
答:资源治理由运营方管理。运营方为客户分配资源配额。