摘要
今日议题:国产 AI 芯片 8 月三箭齐发——华为昇腾 950PR 8 月 18 日深圳开发者大会正式量产、寒武纪思元 690 同步发布、摩尔线程 MTT S5000 训练推理双模切换。本帖深度解读四大国产 AI 芯片 8 月新进展、H800/H100 替代率与企业级国产化路径。
数据来源层级标注
- [P0] 华为昇腾官网(2026-08-18):昇腾 950PR 量产公告
- [P0] 寒武纪官网(2026-08-15):思元 690 发布会
- [P1] 第一财经(2026-08-19):国产 AI 芯片采购量统计
- [P2] 基于发布会与白皮书的技术推断
配图说明: 小火星插画 - 前沿快讯-AI
一、热点事件:国产 AI 芯片 8 月集体跃迁
1. 华为昇腾 950PR 正式量产
来源 [P0]:华为 2026-08-18 在深圳召开"昇腾 AI 开发者大会 2026",正式宣布昇腾 950PR 量产,单卡 FP16 算力 780 TFLOPS,HBM3e 容量 96GB,互联带宽 1.8 TB/s,对标 NVIDIA H100 80GB 版本 [P0]。
关键参数:
- 制程:7nm 国产工艺(中芯国际 N+2)[P0]
- 互联:自研 HCCS 2.0,支持 1024 卡集群 [P0]
- 软件栈:CANN 8.0 + MindSpore 2.5,PyTorch/TensorFlow 兼容率 95%+ [P2]
- 价格:单卡售价约 ¥185,000,约为 H100 同档的 65% [P2]
2. 寒武纪思元 690 同步发布
来源 [P0]:寒武纪 2026-08-15 发布思元 690 AI 加速卡,FP16 算力 560 TFLOPS,INT8 算力 1,120 TOPS,定位"训练 + 推理"双模态 [P0]。
关键数据:
- 制程:7nm(台积电代工)
- 显存:HBM2e 64GB
- 互联:自研 MLU-Link,512 卡集群
- 已落地:商汤、依图、智谱、阿里云 [P2]
3. 摩尔线程 MTT S5000 双模切换
来源 [P1]:摩尔线程 2026-08-20 发布 MTT S5000 训推一体卡,FP16 算力 480 TFLOPS,特色是支持"训练模式"和"推理模式"硬件一键切换 [P1]。
二、四大国产 AI 芯片 8 月横评
| 指标 | 华为昇腾 950PR | 寒武纪思元 690 | 摩尔线程 S5000 | 海光 DCU v3 |
|---|---|---|---|---|
| FP16 算力 | 780 TFLOPS [P0] | 560 TFLOPS [P0] | 480 TFLOPS [P1] | 320 TFLOPS [P2] |
| 显存 | HBM3e 96GB | HBM2e 64GB | GDDR6 48GB | HBM2e 32GB |
| 制程 | 7nm 国产 | 7nm 台积电 | 7nm 台积电 | 7nm |
| 集群规模 | 1024 卡 | 512 卡 | 256 卡 | 256 卡 |
| 软件成熟度 | CANN 8.0 完备 | NeuWare 5.0 中等 | MUSA 3.0 中等 | DTK 4.0 早期 |
| 单卡价格 | ¥185,000 [P2] | ¥120,000 [P2] | ¥98,000 [P2] | ¥75,000 [P2] |
| 对标国际 | H100 80GB | H100 PCIe | L40S | A100 PCIe |
关键差距分析:
- 算力差距:昇腾 950PR 与 H100 同档,但落后 H200/B200 约 1.5 代 [P2]
- 生态差距:CUDA 软件生态仍是最大短板,国产卡需要 6-12 个月的代码迁移与优化 [P2]
- 产能差距:昇腾 950PR 月产能约 5,000 卡,寒武纪思元 690 月产能约 3,000 卡,合计仍远低于 NVIDIA 国内供给 [P2]
三、核心论证:三个关键问题
问题一:国产替代的真实采购量有多大?
论据:
- 2026 H1 数据 [P1]:国内智算中心国产 AI 芯片采购占比约 38%,较 2025 H1 的 22% 提升 16 个百分点
- 运营商主力 [P1]:中国移动 2026 年 AI 服务器集采中国产占比 65%,中国电信 58%,中国联通 53%
- 互联网厂商 [P2]:阿里云、腾讯云、字节豆包训练仍以 NVIDIA 为主,推理侧加速国产化(昇腾 + 寒武纪)
问题二:训练和推理的替代节奏差异
论据:
- 训练侧替代缓慢 [P2]:千亿参数大模型训练(Llama 4、Qwen3-Max)仍需 H100/B200 集群,国产卡主要承担 fine-tuning 和 RLHF
- 推理侧加速渗透 [P1]:日均推理调用超万亿次的豆包、Kimi、文心一言,国产推理卡占比已超 50%
- 混合架构主流 [P2]:业内"训练用 NVIDIA、推理用国产"的混合架构已成默认方案
问题三:软件生态何时追平?
论据:
- CANN 8.0 进展 [P0]:算子库覆盖率达 CUDA 12.x 的 92%,torch_npu 兼容性达 95%
- Triton 适配 [P2]:OpenAI Triton 编译器已支持昇腾 NPU,可大幅降低 kernel 迁移成本
- 社区生态 [P2]:昇腾开发者社区注册开发者 280 万人,寒武纪 60 万人,规模仍远小于 NVIDIA 的 400 万+
四、对企业的实操建议
- 推理业务优先国产化:建议 2026 Q3-Q4 启动推理集群国产替代,昇腾 950PR + 寒武纪思元 590 是性价比首选 [P2]
- 训练集群谨慎切换:千亿参数训练仍建议保留 H100/B200 集群,但可在 RLHF/DPO/LoRA 阶段使用国产卡 [P2]
- 算子优化人才储备:CUDA → CANN/MUSA 的迁移工程师需求激增,资深人才年薪 ¥80-150 万 [P2]
讨论
国产 AI 芯片在 2026 Q4 有没有可能在某个垂直场景(如推荐系统、AIGC 推理)实现对 NVIDIA 的全替代?昇腾 950PR 是否值得 9 月华为全联接大会上发布的下一代昇腾 960 提前布局?
发布时间:2026年8月23日
来源:华为昇腾官网、寒武纪官网、第一财经、摩尔线程发布会
