华为云平台架构理解方法详解(IaaS/tPaaS/aPaaS 三层与 AI 原生演进详解)

「一切皆服务」是读懂华为云平台架构的总入口。底层 IaaS 提供算力、存储、网络、安全等基础设施;中间 tPaaS 把数据库、中间件、AI 框架、容器与开发流水线封装成可调用的技术能力;上层 aPaaS 把行业经验沉淀为可复用的业务能力组合。三层不是产品清单,而是「选型时该从哪一层切入」的判断尺——关心机房与 CPU 走 IaaS,关心工作流与模型走 tPaaS,关心行业模板与合规交付走 aPaaS。把这一组概念边界先讲清楚,下面所有产品、混合云路径与 AI 原生演进都只是这条主线的展开。

一、三层服务的核心定义

IaaS:基础设施即服务

IaaS 是把计算、存储、网络、安全等「机房级」资源做成可按需申请的虚拟资源池。最小单位是一台云服务器(ECS/BMS)、一块云硬盘(EVS)、一个对象存储桶(OBS)、一个虚拟私有云(VPC)。调用方关心的是规格、带宽、可用区,而不是机房里的机柜长什么样。

tPaaS:技术即服务

tPaaS 是把「技术嵌入业务」中间件、AI 框架、数据库、容器平台、研发流水线封装成可编排的能力。调用方关心的是某项能力怎么用、怎么跟业务对接,而不是这项能力的内核是怎么实现的。典型代表是 GaussDB、CCE、ModelArts、AgentArts、CodeArts。

aPaaS:经验即服务

aPaaS 不强调某一项底层技术,而是把行业经验、合规要求、运营流程沉淀为「积木式」的能力组合。调用方关心的是某类业务能否直接复用、是否符合监管要求、能否快速上线。典型形态是政务云、金融云、工业云等「行业云」以及华为云 Stack 这类混合云产品族。

服务层 提供的核心能力 典型服务 调用方关心什么
IaaS 算力 / 存储 / 网络 / 安全 ECS、BMS、OBS、VPC、ELB 规格、可用区、带宽
tPaaS 数据库 / 中间件 / AI / 容器 / 研发流水线 GaussDB、CCE、ModelArts、AgentArts、CodeArts 能力怎么用、怎么对接业务
aPaaS 行业经验 / 合规模板 / 业务积木 政务云 aPaaS、工业云 aPaaS、华为云 Stack 业务能否直接复用

二、平台架构的树形视图

把平台从底向上展开,可以画成下面这张「能力堆叠图」。每一层都是下一层的消费方,下一层为上一层提供能力支撑:

华为云平台(一切皆服务)
│
├── IaaS 层
│   ├── 基础设施:ECS / BMS / OBS / EVS / VPC / ELB
│   ├── 全球基础设施:Region × AZ × KooVerse
│   └── 算力底座:鲲鹏(通用)+ 昇腾(AI)+ 鸿蒙(端)
│
├── tPaaS 层
│   ├── 数据库:GaussDB(OLTP)、TaurusDB(MySQL 兼容)、GeminiDB(多模 NoSQL)、DDM(分库分表)
│   ├── AI 与开发:ModelArts、AgentArts(智果)、MaaS、CodeArts
│   └── 容器与调度:CCE、CCI、Volcano、Karmada、KubeEdge
│
└── aPaaS 层
    ├── 行业云:政务云 / 金融云 / 工业云 / 医疗云
    └── 混合云:华为云 Stack(HCF / HCS / HCSD 三大产品族)

关键观察:IaaS 是「机房」,tPaaS 是「机房上盖的工具间」,aPaaS 是「工具间上盖的样板间」。调用方越往上看,越不关心底层是怎么搭的——这是「一切皆服务」最朴素的理解方式。

# 三层速记
IaaS:  机房 — 关心 CPU/内存/盘/带宽
tPaaS: 工具间 — 关心怎么用、怎么对接业务
aPaaS: 样板间 — 关心能否直接复用、是否合规

三、全球基础设施:Region、AZ 与 KooVerse

华为云基础设施以「全球存算网 KooVerse」对外口径展现,覆盖多个地理区域(Region)与可用区(AZ)。Region 是地理概念,AZ 是同一 Region 内通过高速光纤互联的独立故障域——这是混合云迁移、多账号部署、跨地域容灾的「画图起点」。

底层网络由 QingTian 分布式架构承载,把计算、存储、网络资源对等互连,突破传统主从结构对带宽与扩展性的限制,是 AI 算力基础设施的关键底座。数据中心侧近年向高密度、全液冷方向演进——AI 数据中心单机柜功率密度明显提升,PUE 指标下降明显,液冷和更高密度部署已是 AI 算力机房的事实选项。

规划要素 常见做法 适用业务
Region 选点 南北向流量就近接入 终端用户分布广的 ToC 业务
多 AZ 部署 东西向流量控制在同 Region 内 同城多活、低延迟分布式系统
物理隔离 单独 Region / 专属 AZ 政企、金融、医疗等强合规场景

合规与认证方面,平台覆盖 ISO 27001、ISO 22301、SOC 2、PCI DSS、CSA STAR、等保等通用安全合规,方便做跨境业务与政企项目交付。

四、算力底座:鲲鹏、昇腾、鸿蒙三大根生态

算力底座由鲲鹏通用算力、昇腾智能算力、鸿蒙端侧生态共同支撑,三个根生态分别面向「通用计算」「AI 计算」「端云协同」三类负载。

  • 鲲鹏(通用算力):ARM 架构的自研 CPU,配合 Huawei Cloud EulerOS 与 Kunpeng DevKit/BoostKit,让传统应用迁移到 ARM 平台时尽量减少改动;
  • 昇腾(智能算力):通过 MindSpore 全栈 AI 框架与 ModelArts 平台提供端边云协同的训推一体能力,近年通过 CloudMatrix 384 超节点架构实现算力、内存、显存解耦池化,支撑 MoE 大模型推理与一卡一专家的细粒度调度;
  • 鸿蒙(端侧):通过云桌面与云手机打通鸿蒙设备与传统 Windows 生态的应用兼容性,是端云一体体验的统一入口。
算力类型 适用负载 代表技术
鲲鹏 / x86(通用) Web、数据库、企业应用 Kunpeng DevKit、Huawei Cloud EulerOS
昇腾(AI) 模型训练与推理 CloudMatrix 超节点、MindSpore、EMS 弹性内存存储
鸿蒙(端侧) 终端协同、移动场景 云桌面、云手机、鸿蒙智联

五、与主流云平台的概念对比

华为云的「IaaS / tPaaS / aPaaS」分层与 AWS、阿里云、Azure 的分层在概念上是对齐的,但有几个本地化点值得拎出来:

概念 华为云 AWS 阿里云
基础设施 IaaS EC2 / S3 / VPC ECS / OSS / VPC
技术中台 tPaaS RDS / EKS / SageMaker RDS / ACK / PAI
行业经验 aPaaS(行业云 / Stack) 无统一命名,分布到各服务 行业云、钉钉、达摩院输出
全球存算网 KooVerse Global Infrastructure 阿里云全球基础设施
自研 CPU 鲲鹏(ARM) Graviton(ARM) 平头哥(ARM)
自研 AI 芯片 昇腾 Trainium / Inferentia 含光 800

关键观察:分层概念是行业共识,自研芯片和全球存算网是各家做差异化的主线。选型时不要被「分层叫什么名字」困住,而要看每一层提供的能力是否覆盖业务需求——这才是分层架构真正的价值。

六、AI 原生演进:从「Cloud for AI」走向「AI for Cloud」

华为云近年明确把平台演进方向归为「AI 原生」,对应的三层架构分别是:

  1. AI 原生资源层——围绕算力、存储、网络三个领域做解耦与池化,按「量体裁衣」的方式动态供给,匹配不同 AI 负载;
  2. AI 原生 OS 层——提供 AI 训推开发套件、数据使能平台、L0 级基础大模型,向上提供通用 AI 能力;
  3. AI 原生应用层——按 L1 行业大模型、L2 场景模型、AI 原生应用逐层落地,与业务流程深度耦合。

落到代码上,CCE Autopilot 把集群维护、节点扩缩、操作系统全部托管,业务侧只提交容器工作负载。下面是一段精简可用的 Pod 描述,演示在 CCE Autopilot 上跑一个调用 MaaS 模型的 Agent 网关:

apiVersion: apps/v1
kind: Deployment
metadata:
  name: agent-gateway
  namespace: ai-prod
spec:
  replicas: 2
  selector:
    matchLabels:
      app: agent-gateway
  template:
    metadata:
      labels:
        app: agent-gateway
    spec:
      containers:
        - name: agent
          image: swr.cn-north-4.myhuaweicloud.com/ai/agent-gateway:1.0
          resources:
            requests:
              cpu: "500m"
              memory: "1Gi"
              huawei.com/ascend-npu: "1"
          env:
            - name: MAAS_ENDPOINT
              value: "https://maas.cn-north-4.myhuaweicloud.com/v1"
            - name: MAAS_MODEL
              value: "pangu-nlp-718b"

这段配置把 agent-gateway 镜像按 2 副本部署、按需申请 1 张 NPU 算力、通过 MAAS_* 环境变量指向具体模型。CCE Autopilot 会自动调度到合适的昇腾超节点上,弹性伸缩与节点运维全部交给平台侧,业务侧只需要关注模型调用与业务流程。

到这里,平台的三层服务、全球基础设施、算力底座、AI 原生演进四条线就拼成了一张完整地图。核心是「一切皆服务」这条主线——分层不是用来背产品清单的,而是用来回答「我应该从哪一层切入」的判断尺。下一步无论是走公有云、混合云还是私有云,路径都有迹可循。

常见问题(FAQ)

Q1:平台层和云产品是什么关系?

平台层是统一的架构与能力底座(IaaS/tPaaS/aPaaS),云产品是它在某一类场景下的具体实现,例如 tPaaS 层的数据库就由 GaussDB、RDS 等产品承载。

Q2:华为云 Stack 跟公有云有什么区别?

公有云是华为云统一运营的全球可用服务,Stack 把同源能力部署到客户本地数据中心,适配本地合规、低时延、混合架构等场景。

Q3:AI 原生和传统云上跑 AI 的差别是什么?

传统云上跑 AI 是用通用算力当「载体」,AI 应用仍需自行优化算力调度与存储;AI 原生把算力、内存、网络按 AI 负载特征重新设计,从一开始就以 AI 工作负载为核心。

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 qiqicto@qq.com 举报,一经查实,本站将立刻删除。
赞 (0)
赵其鑫的头像赵其鑫管理团队

相关推荐

返回顶部