海光 DCU:CUDA 兼容路线的算子覆盖率与千卡落地
海光深算三号已实现量产,公开口径为算子覆盖率超过 99%,支持千亿级大模型训练与推理;其 CPU 与 DCU 已应用于十万卡级 AI 超集群。
产品路线
海光信息是国内同时实现 x86 CPU 与 AI 加速 DCU 双量产的企业。DCU 深算系列采用 GPGPU 架构,兼容 CUDA 生态——这条路线降低了应用迁移成本,但要求厂商在指令兼容与算子覆盖上持续投入。
公开的技术指标
据公开资料,深算三号采用 7nm 工艺与 Chiplet 封装并已实现量产,算子覆盖率超过 99%,支持千亿级大模型训练与推理;新一代深算四号搭配自研交换芯片,用于提升集群互联能力。公开信息还提到,其 CPU 与 DCU 已应用于十万卡级 AI 超集群。
在安全特性上,C86 系列处理器内置国密加解密引擎、TEE 机密计算环境等硬件安全引擎。
一个融合场景的落地
2026 年 6 月,全国首个 AI4E 千卡工科智算集群落地同济大学,以海光 DCU 为核心算力底座,采用超智融合架构,可同步承载高端计算与 AI 训练推理任务。
兼容路线的真实成本
"兼容 CUDA"通常意味着迁移工作量低于重写,但不会为零。评估时值得要求供应商提供针对自身模型与框架版本的实测结果(算子覆盖清单、性能对比、已知限制),并把适配与验证时间计入项目排期。
参考来源:中国经济新闻网 ↗
内容更新时间:2026.09.16反馈与纠错 ↗