大模型训练从单机八卡迈向千卡集群,真正决定效率的不是单卡峰值算力,而是「卡间互联、显存带宽、内存池化、液冷密度」四条线能不能闭环。华为昇腾(Ascend)Atlas 系列走 NPU + 达芬奇架构路线,从 Atlas 300T 训练卡、Atlas 800T 训练服务器到 Atlas 900 A3 SuperPoD 超节点,覆盖 28 TFLOPS 到 307 PFLOPS FP16 的全档位算力。下面按「架构怎么理解、训练怎么选、推理怎么选、超节点怎么搭、生态怎么接」五条路径拆解。
一、达芬奇架构与 GPU 的差异
昇腾 NPU 的核心是达芬奇(Da Vinci)架构,采用 3D Cube 计算单元专门做矩阵运算,与传统 GPU 的 Tensor Core 路径不同。理解这条差异,才能把昇腾的算力参数读懂:
| 维度 | 昇腾 NPU | 主流 GPU |
|---|---|---|
| 计算单元 | 3D Cube(达芬奇) | Tensor Core |
| 内存层次 | HBM + SRAM 多级缓存 | HBM + L1/L2 |
| 编程模型 | Ascend C / CANN | CUDA C++ |
| 互联协议 | HCCS、灵衢 | NVLink、InfiniBand |
| 生态定位 | 国产化、根技术 | 全球通用 |
昇腾 910B 单卡 FP16 算力 320 TFLOPS、INT8 算力 640 TOPS,显存 64GB HBM2e。昇腾 910C 进一步把显存推到 128GB HBM3、FP16 算力拉到 752–800 TFLOPS、互联带宽提到 3.2 TB/s,搭配 SMIC N+2 工艺,正在成为 2026 年国产 AI 算力的主力档位。
编程入口是华为自研的 CANN(Compute Architecture for Neural Networks),上层框架同时支持原生 MindSpore 与兼容 PyTorch、TensorFlow。开发者不用重写算子,CANN 屏蔽底层硬件差异,迁移成本主要集中在数据并行、流水并行的策略调整。
二、训练卡与训练服务器选型
训练场景看重「FP16/BF16 算力 + 显存容量 + 卡间互联」三件事,Atlas 800T 训练服务器是承接大模型训练的主力机型,内部按节点规模分 A2 和 A3 两代:
| 型号 | 单卡 FP16 | 显存 | 卡间互联 | 整机规模 | 典型负载 |
|---|---|---|---|---|---|
| Atlas 800T A2 | 320 TFLOPS | 64GB HBM2e | HCCS 1.6 Tbps | 8 卡/机 | 70B 以下模型训练 |
| Atlas 800T A3 | 720+ TFLOPS | 128GB HBM3 | 灵衢 3.2 TB/s | 8 卡/机 | 100B+ 模型训练 |
| Atlas 900 A2 PoD | 2.24 PFLOPS FP16 | — | 100G/200G RoCE | 64 卡/PoD | 集群训练 |
| Atlas 900 A3 SuperPoD | 307.2 PFLOPS FP16 | 48TB 片上内存统一编址 | 灵衢 784GB/s 双向 | 384 卡/超节点 | 万亿参数大模型 |
A2 代次基于昇腾 910B,A3 代次基于昇腾 910C。Atlas 900 A3 SuperPoD 是 2026 年的旗舰形态:12 个 47U 计算柜 + 4 个总线设备柜,最大 384 张 NPU 像「一台计算机」协同工作,D2D 双向带宽 784GB/s,支持 16/32/64/128/256/384 卡的逻辑超节点线性扩展。
液冷散热是 A3 SuperPoD 的关键工程能力。计算柜用全液冷,总线设备柜保留风冷,整体 PUE 优于传统风冷集群。配合华为星河 AI 智算交换机 CloudEngine XH16800 的 800GE 高密端口,两层交换网络即可支撑 2250 节点(等效 1.8 万卡)的无收敛组网。
三、推理卡与推理服务器选型
推理场景看重「INT8 算力 + 视频解码 + 功耗」,Atlas 800I 推理服务器与 Atlas 300I 推理卡是主力档位:
| 型号 | INT8 算力 | 接口 | 形态 | 典型场景 |
|---|---|---|---|---|
| Atlas 300I Pro | 88 TOPS | PCIe x16 Gen3 | 单卡 | 边缘推理、图像分类 |
| Atlas 800I A2 | 最多 704 TOPS | 9×PCIe 4.0 | 4U 服务器 | 中心推理、视频分析 |
| Atlas 300V | 视频分析专用 | PCIe | 单卡 | 城市运营、视频结构化 |
| Atlas 500 A2 边缘站 | — | 整机 | 边缘节点 | 工厂、园区、加油站 |
Atlas 800I A2 推理服务器在 4U 空间内提供 704 TOPS INT8 算力,最多 9 个 PCIe 4.0 接口,适合做大规模 AI 推理服务的中心节点。边缘侧 Atlas 500 A2 智能小站支持 Atlas 300I Pro 与 300V 的灵活组合,落到工厂质检、园区安防、加油站合规检测等场景,不用单独建机房。
视频结构化场景单独看 Atlas 300V 系列。V Pro 在 V 基础上增加 4K 解码与多路并发能力,典型用法是城市级视频联网,单台 4U 服务器可接入 64–128 路摄像头并实时出结构化结果。
四、6 维对比:训练 vs 推理
把训练与推理两条线在统一维度下铺开,是避免”训练卡跑推理浪费算力、推理卡跑训练带不动”的关键:
| 维度 | 训练 | 推理 |
|---|---|---|
| 核心算力指标 | FP16/BF16 TFLOPS | INT8 TOPS |
| 显存需求 | 大(≥ 64GB) | 中(16-32GB 够用) |
| 卡间互联要求 | 高(HCCS/灵衢) | 低(PCIe 即可) |
| 典型功耗 | 700-1000W/卡 | 150-300W/卡 |
| 部署密度 | 整机柜级 | 单卡到 4U 灵活 |
| 关注成本 | 训练时长 × 算力单价 | 单次请求延迟 × QPS |
关键观察:训练卡的强项是 FP16/BF16 算力与卡间互联,弱项是单瓦算力性价比;推理卡的强项是 INT8 算力密度与功耗控制,弱项是卡间带宽与显存容量。用训练卡做中心推理 = 花 3 倍电费换 1.5 倍吞吐,多数场景是负优化。
五、超节点与集群组网
千卡以上训练,瓶颈在卡间互联,不在单卡算力。Atlas 900 A3 SuperPoD 给出的方案是「超节点 + 灵衢」:
- D2D 高速互联:384 卡之间通过灵衢互联协议做点对点通信,双向带宽 784GB/s,远高于传统 PCIe 5.0;
- 内存统一编址:48TB 片上内存像访问本地内存一样被任意卡调用,数据无需「跨卡拷贝」;
- 总线设备柜分离:把 PCIe 设备、存储、网络等「外设」集中到 4 个总线柜,计算柜只留 NPU,散热与维护效率提升;
- 光电融合突破物理极限:单根光模块带宽达到 800G,实现 384 卡无损域内通信;
- 并行策略:数据并行、张量并行、流水并行、专家并行在 CANN 调度器中可灵活组合,适合 MoE 架构。
传统千卡集群的算力利用率通常不到 40%,超节点架构把「计算不等待通信」变成工程常态,大模型训练的有效算力明显提升。注意:超节点的算力利用率优势需要并行策略与数据流水线配合才能兑现,仅堆硬件并不能自动拿到收益。
六、Atlas 200 DK 开发者套件
开发者套件是昇腾生态的入口。Atlas 200I DK A2 是当前主流的开发板,提供与服务器端相同的 CANN 软件栈:
- 处理器:昇腾 310,16 TOPS INT8 算力;
- 内存:8GB LPDDR4X,16GB eMMC;
- 接口:千兆以太网、USB 3.0、HDMI、M.2;
- 操作系统:openEuler Embedded、Ubuntu;
- 编程:Ascend C、Python、MindSpore。
开发者套件的真正价值不是算力参数,而是「模型在 PC 上跑通后,直接烧录到服务器集群」的一致性。MindSpore 的 IR 图、Ascend C 的算子实现,在 DK 板上与 Atlas 900 A3 SuperPoD 上是同一套二进制,减少「开发环境跑得通、生产环境跑不动」的迁移成本。
七、MindSpore 与 CANN 的软件栈
昇腾生态的真正护城河是软件栈。MindSpore 是华为自研的 AI 框架,CANN 是异构计算架构,二者加上 openEuler 操作系统构成完整的全栈优化:
import mindspore as ms
from mindspore import nn, ops
# MindSpore 在昇腾 NPU 上的训练示例
ms.set_context(mode=ms.GRAPH_MODE, device_target="Ascend")
class SimpleNet(nn.Cell):
def __init__(self):
super().__init__()
self.fc = nn.Dense(1024, 10)
def construct(self, x):
return self.fc(x)
net = SimpleNet()
loss_fn = nn.SoftmaxCrossEntropyWithLogits()
optimizer = nn.Adam(net.trainable_params(), learning_rate=1e-3)
model = ms.Model(net, loss_fn, optimizer)
# 训练入口,device_target=Ascend 时自动调用 CANN
model.train(epoch=10, train_dataset=ds_train)
这段示例展示了 MindSpore 在昇腾 NPU 上的训练入口。device_target="Ascend" 告诉运行时把算子派发给 CANN,CANN 内部完成图编译、内存分配、昇腾 910C 指令发射。模型从训练到部署的链路只用 MindSpore + CANN 两套组件,不需要再单独配 CUDA + cuDNN。
八、选型落地路径
回到选型本身:训练任务按模型规模分档,70B 以下选 Atlas 800T A2,100B 以上选 Atlas 800T A3,万亿参数直接上 Atlas 900 A3 SuperPoD;推理任务按延迟与并发选型,中心大并发选 Atlas 800I A2,边缘低延迟选 Atlas 300I Pro 或 Atlas 500 A2 智能小站;开发者从 Atlas 200I DK A2 起步,保证训练-部署一致性。
典型落地顺序是先用 DK 板验证模型与算子,再到 Atlas 800T A2 跑通 8 卡分布式训练,最后在 Atlas 900 A3 SuperPoD 上做 384 卡超节点训练与 MoE 改造。注意:超节点环境对机房供电、液冷管路与网络密度都有要求,新建机房比改造旧机房成本更低。
到这里,昇腾架构、训练档位、推理档位、6 维差异、超节点组网、DK 套件与软件栈就完整了。核心是按”模型规模 + 互联需求”选训练档位,按”延迟 + 功耗”选推理档位——别被单卡峰值算力迷惑,集群效率由整条链路里较薄弱的环节决定。
常见问题(FAQ)
Q1:昇腾 NPU 能跑 PyTorch 吗?
可以,CANN 提供 PyTorch 兼容模式,主流算子可直接迁移,MoE 改造需少量定制。
Q2:Atlas 900 A3 SuperPoD 最小起订规模?
超节点支持 16/32/64 卡逻辑配置,小规模训练可以先买 16 卡起步再线性扩展。
Q3:昇腾 910C 什么时候能量产?
2026 年起在 Atlas 800T A3 与 Atlas 900 A3 SuperPoD 上逐步上量,可联系供应商确认到货周期。