「一切皆服务」是读懂华为云平台架构的总入口。底层 IaaS 提供算力、存储、网络、安全等基础设施;中间 tPaaS 把数据库、中间件、AI 框架、容器与开发流水线封装成可调用的技术能力;上层 aPaaS 把行业经验沉淀为可复用的业务能力组合。三层不是产品清单,而是「选型时该从哪一层切入」的判断尺——关心机房与 CPU 走 IaaS,关心工作流与模型走 tPaaS,关心行业模板与合规交付走 aPaaS。把这一组概念边界先讲清楚,下面所有产品、混合云路径与 AI 原生演进都只是这条主线的展开。
一、三层服务的核心定义
IaaS:基础设施即服务
IaaS 是把计算、存储、网络、安全等「机房级」资源做成可按需申请的虚拟资源池。最小单位是一台云服务器(ECS/BMS)、一块云硬盘(EVS)、一个对象存储桶(OBS)、一个虚拟私有云(VPC)。调用方关心的是规格、带宽、可用区,而不是机房里的机柜长什么样。
tPaaS:技术即服务
tPaaS 是把「技术嵌入业务」中间件、AI 框架、数据库、容器平台、研发流水线封装成可编排的能力。调用方关心的是某项能力怎么用、怎么跟业务对接,而不是这项能力的内核是怎么实现的。典型代表是 GaussDB、CCE、ModelArts、AgentArts、CodeArts。
aPaaS:经验即服务
aPaaS 不强调某一项底层技术,而是把行业经验、合规要求、运营流程沉淀为「积木式」的能力组合。调用方关心的是某类业务能否直接复用、是否符合监管要求、能否快速上线。典型形态是政务云、金融云、工业云等「行业云」以及华为云 Stack 这类混合云产品族。
| 服务层 | 提供的核心能力 | 典型服务 | 调用方关心什么 |
|---|---|---|---|
| IaaS | 算力 / 存储 / 网络 / 安全 | ECS、BMS、OBS、VPC、ELB | 规格、可用区、带宽 |
| tPaaS | 数据库 / 中间件 / AI / 容器 / 研发流水线 | GaussDB、CCE、ModelArts、AgentArts、CodeArts | 能力怎么用、怎么对接业务 |
| aPaaS | 行业经验 / 合规模板 / 业务积木 | 政务云 aPaaS、工业云 aPaaS、华为云 Stack | 业务能否直接复用 |
二、平台架构的树形视图
把平台从底向上展开,可以画成下面这张「能力堆叠图」。每一层都是下一层的消费方,下一层为上一层提供能力支撑:
华为云平台(一切皆服务)
│
├── IaaS 层
│ ├── 基础设施:ECS / BMS / OBS / EVS / VPC / ELB
│ ├── 全球基础设施:Region × AZ × KooVerse
│ └── 算力底座:鲲鹏(通用)+ 昇腾(AI)+ 鸿蒙(端)
│
├── tPaaS 层
│ ├── 数据库:GaussDB(OLTP)、TaurusDB(MySQL 兼容)、GeminiDB(多模 NoSQL)、DDM(分库分表)
│ ├── AI 与开发:ModelArts、AgentArts(智果)、MaaS、CodeArts
│ └── 容器与调度:CCE、CCI、Volcano、Karmada、KubeEdge
│
└── aPaaS 层
├── 行业云:政务云 / 金融云 / 工业云 / 医疗云
└── 混合云:华为云 Stack(HCF / HCS / HCSD 三大产品族)
关键观察:IaaS 是「机房」,tPaaS 是「机房上盖的工具间」,aPaaS 是「工具间上盖的样板间」。调用方越往上看,越不关心底层是怎么搭的——这是「一切皆服务」最朴素的理解方式。
# 三层速记
IaaS: 机房 — 关心 CPU/内存/盘/带宽
tPaaS: 工具间 — 关心怎么用、怎么对接业务
aPaaS: 样板间 — 关心能否直接复用、是否合规
三、全球基础设施:Region、AZ 与 KooVerse
华为云基础设施以「全球存算网 KooVerse」对外口径展现,覆盖多个地理区域(Region)与可用区(AZ)。Region 是地理概念,AZ 是同一 Region 内通过高速光纤互联的独立故障域——这是混合云迁移、多账号部署、跨地域容灾的「画图起点」。
底层网络由 QingTian 分布式架构承载,把计算、存储、网络资源对等互连,突破传统主从结构对带宽与扩展性的限制,是 AI 算力基础设施的关键底座。数据中心侧近年向高密度、全液冷方向演进——AI 数据中心单机柜功率密度明显提升,PUE 指标下降明显,液冷和更高密度部署已是 AI 算力机房的事实选项。
| 规划要素 | 常见做法 | 适用业务 |
|---|---|---|
| Region 选点 | 南北向流量就近接入 | 终端用户分布广的 ToC 业务 |
| 多 AZ 部署 | 东西向流量控制在同 Region 内 | 同城多活、低延迟分布式系统 |
| 物理隔离 | 单独 Region / 专属 AZ | 政企、金融、医疗等强合规场景 |
合规与认证方面,平台覆盖 ISO 27001、ISO 22301、SOC 2、PCI DSS、CSA STAR、等保等通用安全合规,方便做跨境业务与政企项目交付。
四、算力底座:鲲鹏、昇腾、鸿蒙三大根生态
算力底座由鲲鹏通用算力、昇腾智能算力、鸿蒙端侧生态共同支撑,三个根生态分别面向「通用计算」「AI 计算」「端云协同」三类负载。
- 鲲鹏(通用算力):ARM 架构的自研 CPU,配合 Huawei Cloud EulerOS 与 Kunpeng DevKit/BoostKit,让传统应用迁移到 ARM 平台时尽量减少改动;
- 昇腾(智能算力):通过 MindSpore 全栈 AI 框架与 ModelArts 平台提供端边云协同的训推一体能力,近年通过 CloudMatrix 384 超节点架构实现算力、内存、显存解耦池化,支撑 MoE 大模型推理与一卡一专家的细粒度调度;
- 鸿蒙(端侧):通过云桌面与云手机打通鸿蒙设备与传统 Windows 生态的应用兼容性,是端云一体体验的统一入口。
| 算力类型 | 适用负载 | 代表技术 |
|---|---|---|
| 鲲鹏 / x86(通用) | Web、数据库、企业应用 | Kunpeng DevKit、Huawei Cloud EulerOS |
| 昇腾(AI) | 模型训练与推理 | CloudMatrix 超节点、MindSpore、EMS 弹性内存存储 |
| 鸿蒙(端侧) | 终端协同、移动场景 | 云桌面、云手机、鸿蒙智联 |
五、与主流云平台的概念对比
华为云的「IaaS / tPaaS / aPaaS」分层与 AWS、阿里云、Azure 的分层在概念上是对齐的,但有几个本地化点值得拎出来:
| 概念 | 华为云 | AWS | 阿里云 |
|---|---|---|---|
| 基础设施 | IaaS | EC2 / S3 / VPC | ECS / OSS / VPC |
| 技术中台 | tPaaS | RDS / EKS / SageMaker | RDS / ACK / PAI |
| 行业经验 | aPaaS(行业云 / Stack) | 无统一命名,分布到各服务 | 行业云、钉钉、达摩院输出 |
| 全球存算网 | KooVerse | Global Infrastructure | 阿里云全球基础设施 |
| 自研 CPU | 鲲鹏(ARM) | Graviton(ARM) | 平头哥(ARM) |
| 自研 AI 芯片 | 昇腾 | Trainium / Inferentia | 含光 800 |
关键观察:分层概念是行业共识,自研芯片和全球存算网是各家做差异化的主线。选型时不要被「分层叫什么名字」困住,而要看每一层提供的能力是否覆盖业务需求——这才是分层架构真正的价值。
六、AI 原生演进:从「Cloud for AI」走向「AI for Cloud」
华为云近年明确把平台演进方向归为「AI 原生」,对应的三层架构分别是:
- AI 原生资源层——围绕算力、存储、网络三个领域做解耦与池化,按「量体裁衣」的方式动态供给,匹配不同 AI 负载;
- AI 原生 OS 层——提供 AI 训推开发套件、数据使能平台、L0 级基础大模型,向上提供通用 AI 能力;
- AI 原生应用层——按 L1 行业大模型、L2 场景模型、AI 原生应用逐层落地,与业务流程深度耦合。
落到代码上,CCE Autopilot 把集群维护、节点扩缩、操作系统全部托管,业务侧只提交容器工作负载。下面是一段精简可用的 Pod 描述,演示在 CCE Autopilot 上跑一个调用 MaaS 模型的 Agent 网关:
apiVersion: apps/v1
kind: Deployment
metadata:
name: agent-gateway
namespace: ai-prod
spec:
replicas: 2
selector:
matchLabels:
app: agent-gateway
template:
metadata:
labels:
app: agent-gateway
spec:
containers:
- name: agent
image: swr.cn-north-4.myhuaweicloud.com/ai/agent-gateway:1.0
resources:
requests:
cpu: "500m"
memory: "1Gi"
huawei.com/ascend-npu: "1"
env:
- name: MAAS_ENDPOINT
value: "https://maas.cn-north-4.myhuaweicloud.com/v1"
- name: MAAS_MODEL
value: "pangu-nlp-718b"
这段配置把 agent-gateway 镜像按 2 副本部署、按需申请 1 张 NPU 算力、通过 MAAS_* 环境变量指向具体模型。CCE Autopilot 会自动调度到合适的昇腾超节点上,弹性伸缩与节点运维全部交给平台侧,业务侧只需要关注模型调用与业务流程。
到这里,平台的三层服务、全球基础设施、算力底座、AI 原生演进四条线就拼成了一张完整地图。核心是「一切皆服务」这条主线——分层不是用来背产品清单的,而是用来回答「我应该从哪一层切入」的判断尺。下一步无论是走公有云、混合云还是私有云,路径都有迹可循。
常见问题(FAQ)
Q1:平台层和云产品是什么关系?
平台层是统一的架构与能力底座(IaaS/tPaaS/aPaaS),云产品是它在某一类场景下的具体实现,例如 tPaaS 层的数据库就由 GaussDB、RDS 等产品承载。
Q2:华为云 Stack 跟公有云有什么区别?
公有云是华为云统一运营的全球可用服务,Stack 把同源能力部署到客户本地数据中心,适配本地合规、低时延、混合架构等场景。
Q3:AI 原生和传统云上跑 AI 的差别是什么?
传统云上跑 AI 是用通用算力当「载体」,AI 应用仍需自行优化算力调度与存储;AI 原生把算力、内存、网络按 AI 负载特征重新设计,从一开始就以 AI 工作负载为核心。