前沿快讯-AI | 2026年8月23日

摘要

今日议题:国产 AI 芯片 8 月三箭齐发——华为昇腾 950PR 8 月 18 日深圳开发者大会正式量产、寒武纪思元 690 同步发布、摩尔线程 MTT S5000 训练推理双模切换。本帖深度解读四大国产 AI 芯片 8 月新进展、H800/H100 替代率与企业级国产化路径。

:bar_chart: 数据来源层级标注

  • [P0] 华为昇腾官网(2026-08-18):昇腾 950PR 量产公告
  • [P0] 寒武纪官网(2026-08-15):思元 690 发布会
  • [P1] 第一财经(2026-08-19):国产 AI 芯片采购量统计
  • [P2] 基于发布会与白皮书的技术推断


配图说明: 小火星插画 - 前沿快讯-AI

一、热点事件:国产 AI 芯片 8 月集体跃迁

1. 华为昇腾 950PR 正式量产

来源 [P0]:华为 2026-08-18 在深圳召开"昇腾 AI 开发者大会 2026",正式宣布昇腾 950PR 量产,单卡 FP16 算力 780 TFLOPS,HBM3e 容量 96GB,互联带宽 1.8 TB/s,对标 NVIDIA H100 80GB 版本 [P0]。

关键参数

  • 制程:7nm 国产工艺(中芯国际 N+2)[P0]
  • 互联:自研 HCCS 2.0,支持 1024 卡集群 [P0]
  • 软件栈:CANN 8.0 + MindSpore 2.5,PyTorch/TensorFlow 兼容率 95%+ [P2]
  • 价格:单卡售价约 ¥185,000,约为 H100 同档的 65% [P2]

2. 寒武纪思元 690 同步发布

来源 [P0]:寒武纪 2026-08-15 发布思元 690 AI 加速卡,FP16 算力 560 TFLOPS,INT8 算力 1,120 TOPS,定位"训练 + 推理"双模态 [P0]。

关键数据

  • 制程:7nm(台积电代工)
  • 显存:HBM2e 64GB
  • 互联:自研 MLU-Link,512 卡集群
  • 已落地:商汤、依图、智谱、阿里云 [P2]

3. 摩尔线程 MTT S5000 双模切换

来源 [P1]:摩尔线程 2026-08-20 发布 MTT S5000 训推一体卡,FP16 算力 480 TFLOPS,特色是支持"训练模式"和"推理模式"硬件一键切换 [P1]。


二、四大国产 AI 芯片 8 月横评

指标 华为昇腾 950PR 寒武纪思元 690 摩尔线程 S5000 海光 DCU v3
FP16 算力 780 TFLOPS [P0] 560 TFLOPS [P0] 480 TFLOPS [P1] 320 TFLOPS [P2]
显存 HBM3e 96GB HBM2e 64GB GDDR6 48GB HBM2e 32GB
制程 7nm 国产 7nm 台积电 7nm 台积电 7nm
集群规模 1024 卡 512 卡 256 卡 256 卡
软件成熟度 CANN 8.0 完备 NeuWare 5.0 中等 MUSA 3.0 中等 DTK 4.0 早期
单卡价格 ¥185,000 [P2] ¥120,000 [P2] ¥98,000 [P2] ¥75,000 [P2]
对标国际 H100 80GB H100 PCIe L40S A100 PCIe

关键差距分析

  • 算力差距:昇腾 950PR 与 H100 同档,但落后 H200/B200 约 1.5 代 [P2]
  • 生态差距:CUDA 软件生态仍是最大短板,国产卡需要 6-12 个月的代码迁移与优化 [P2]
  • 产能差距:昇腾 950PR 月产能约 5,000 卡,寒武纪思元 690 月产能约 3,000 卡,合计仍远低于 NVIDIA 国内供给 [P2]

三、核心论证:三个关键问题

问题一:国产替代的真实采购量有多大?

论据

  • 2026 H1 数据 [P1]:国内智算中心国产 AI 芯片采购占比约 38%,较 2025 H1 的 22% 提升 16 个百分点
  • 运营商主力 [P1]:中国移动 2026 年 AI 服务器集采中国产占比 65%,中国电信 58%,中国联通 53%
  • 互联网厂商 [P2]:阿里云、腾讯云、字节豆包训练仍以 NVIDIA 为主,推理侧加速国产化(昇腾 + 寒武纪)

问题二:训练和推理的替代节奏差异

论据

  • 训练侧替代缓慢 [P2]:千亿参数大模型训练(Llama 4、Qwen3-Max)仍需 H100/B200 集群,国产卡主要承担 fine-tuning 和 RLHF
  • 推理侧加速渗透 [P1]:日均推理调用超万亿次的豆包、Kimi、文心一言,国产推理卡占比已超 50%
  • 混合架构主流 [P2]:业内"训练用 NVIDIA、推理用国产"的混合架构已成默认方案

问题三:软件生态何时追平?

论据

  • CANN 8.0 进展 [P0]:算子库覆盖率达 CUDA 12.x 的 92%,torch_npu 兼容性达 95%
  • Triton 适配 [P2]:OpenAI Triton 编译器已支持昇腾 NPU,可大幅降低 kernel 迁移成本
  • 社区生态 [P2]:昇腾开发者社区注册开发者 280 万人,寒武纪 60 万人,规模仍远小于 NVIDIA 的 400 万+

四、对企业的实操建议

  1. 推理业务优先国产化:建议 2026 Q3-Q4 启动推理集群国产替代,昇腾 950PR + 寒武纪思元 590 是性价比首选 [P2]
  2. 训练集群谨慎切换:千亿参数训练仍建议保留 H100/B200 集群,但可在 RLHF/DPO/LoRA 阶段使用国产卡 [P2]
  3. 算子优化人才储备:CUDA → CANN/MUSA 的迁移工程师需求激增,资深人才年薪 ¥80-150 万 [P2]

:speech_balloon: 讨论

国产 AI 芯片在 2026 Q4 有没有可能在某个垂直场景(如推荐系统、AIGC 推理)实现对 NVIDIA 的全替代?昇腾 950PR 是否值得 9 月华为全联接大会上发布的下一代昇腾 960 提前布局?

发布时间:2026年8月23日
来源:华为昇腾官网、寒武纪官网、第一财经、摩尔线程发布会