🔗 姊妹篇:A31 AI 编译器 + CUDA 替代(本文,L1 软件层)是 L1《国产 11 厂大乱斗》的软件对应面硬件是躯体,编译器是灵魂——相同的硬件(昇腾 910B),用 CANN 编译 vs 用 torch.compile 性能差距 2-3 倍
A31

AI 编译器 + CUDA 替代软件栈

L1 软件 · 编译层2026-06-29·约 13 分钟阅读·AI 硬件栏目

AI 编译器 = 把 PyTorch 模型变成 GPU/Ascend 可执行指令的转换器CUDA 是 NVIDIA 统治 AI 15 年的护城河(95% AI 训练在 CUDA),全球 AI 软件人才 300 万+ 都在学 CUDA。CUDA 替代品:AMD ROCm / Intel OneAPI / 华为 CANN / 寒武纪 BangC + 开源编译器 TVM/MLIR/Triton。本文拆解分层 + 国际玩家 + 国产突围 + 5 个判断
📑 目录

一、AI 编译器分层

作用代表
前端(Frontend)把 PyTorch / JAX / TF graph 解析为 IRTorchScript · ONNX · Dynamo
中层(Mid-tier)图优化 + 算子融合 + 自动并行Glow · XLA · TensorRT · TVM
后端(Backend)针对硬件(Hopper/A100/Ascend)生成代码CUDA / ROCm / OneAPI / CANN / BangC

二、3 大开源编译器

编译器起源维护方特点
Apache TVM华盛顿大学(陈天奇)Apache 基金会开源 · 跨硬件 · 自动调优
MLIRGoogleLLVM 社区多面体编译器 · 框架
TritonPhilippe Tillet(原 OpenAI)Meta + 社区Python GPU 编程 · 已成 PyTorch 默认 kernel 生成器

三、CUDA 替代四大家

软件栈对应硬件成熟度生态
NVIDIA CUDAH100/B200/Rubin100%(15 年)300 万+ AI 工程师
AMD ROCmMI300X/MI325X~75%(2024-2025 大幅追赶)PyTorch 已支持 · Hugging Face 100%
Intel OneAPIGaudi 2/3 · Xeon · GPU Max~40%(主要Intel芯片)OneDNN · DeepSpeed
华为 CANN昇腾 910B/950~70%(快速迭代)MindSpore + PyTorch(国产 fork)
⚠️ 中国"非 CUDA"AI 算力使用率: - 昇腾 910B:2025 出货 30 万颗 · CANN 软件栈覆盖度从 60%(2024)升到 75%(2025) - 寒武纪 MLU 590:CANN 替代品 BangC · 覆盖度 ~50%(投自动驾驶客户多) - 摩尔线程 MUSA:全栈自研 · 覆盖度 ~30%(从游戏卡转型 AI) - 壁仞 BR104:配合 ROCm-风格 · 覆盖度 ~40% 结论:国产 AI 软件生态"硬件已破、软件还在追赶"

四、国产玩家

玩家软件栈对应硬件2025 进展
华为CANN 7.0 + MindSpore 2.4 + openPangu昇腾 910C/950DeepSeek/V3 全栈昇腾运行(2025 H1)
寒武纪BangC + MagicMindMLU 590/X3自动驾驶(地平线/英伟达 Orin 同级别)
摩尔线程MUSAMTT S5000GPU 国产标杆 · 游戏+AI 双线
壁仞科技BR104 软件栈BR104/B104AI 训练 · 兼容 ROCm 模型
百度PaddlePaddle + 昆仑芯 XPU SDK昆仑芯 P800文心一言训练 · 智能云
阿里Hanguang SDK + 魔搭社区含光 800 / 平头哥阿里云 PAI 平台深度集成
字节LightSeq · MegaScaleDoubao 训练豆包大模型用自研

五、5 个核心判断

  1. CUDA 不是软件,而是"生态":单纯抄 CUDA API 没有意义 · 需要 300 万工程师 + 数万文档 + 几十个 SDK 才叫生态
  2. ROCm 是真正追赶者:AMD MI300X 用 ROCm · 性能已达 CUDA 90% · 2026 是"AMD 反击年"
  3. Triton 是改变游戏规则的开源:PyTorch 2.5+ 已默认用 Triton 生成 GPU kernel · 工程师不再需要手写 CUDA
  4. 华为 CANN + 开源 XuanTie(玄铁) 是中国 AI 算力的最后堡垒 · DeepSeek-R1 推理已在昇腾上稳定运行
  5. 2026-2028 是"CUDA 替代年":GPU 市场由 NVIDIA 90% → 70% · AMD + 华为 + 寒武纪三家瓜分 30%

六、FAQ + 资料来源

Q1:CUDA 真的不能被替代吗?

A:不能被"快速"替代。CUDA 用了 15 年沉淀,5 年内无法复制 · 但 ROCm + Triton 已经让"替代"成为可能。

Q2:Triton 是什么?

A:Python 写 CUDA 的开源框架 · 工程师不需要学 C++ 就能写 GPU 内核 · 已被 PyTorch、TensorRT、OpenAI Triton Inference Server 集成。

Q3:昇腾能跑 PyTorch 吗?

A:可以,但需用 torch_npu fork · 90% PyTorch 模型可直接迁移 · 速度约为 A100 的 80-90%。

Q4:MLIR 在 AI 编译中的位置?

A:MLIR 不是编译器而是"编译器框架" · TVM、Triton、IREE 都在 MLIR 上构建 · 是新一代编译器标准。

Q5:中国 AI 软件人才缺口?

A:约 30 万(2025)· 写 CUDA/Triton 的本科+ 研究生 < 5 万 · 国产替代最大瓶颈不是硬件,而是软件人才。


资料来源: NVIDIA CUDA Toolkit 13.0 文档 · AMD ROCm 6.3 发布说明 · Intel OneAPI 2025.1 · Apache TVM 0.20 GitHub · LLVM/MLIR 18 工程文档 · Triton 3.0 OpenAI GitHub · 华为 CANN 7.0 白皮书 · 寒武纪 BangC 4.0 文档 · 摩尔线程 MUSA 3.0 文档 · PyTorch torch.compile 官方文档 · DeepSeek-V3 昇腾部署报告 2025 H1 · 国际 ML 会议 NeurIPS 编译器论文 · Meta AI Triton 博客 · Hugging Face ROCm 支持状态 2025 · 第一财经《国产 AI 软件栈观察》 · 36Kr《AI 编译器调研》 · 智东西《CAN 相关公司梳理》。

← 返回 AI 硬件栏目