跳到主内容
爱游戏体育网址

DeepSeek加速向华为靠拢

2026-09-30 · 董泽宇 · 更新于 2026-10-02

9月30日,DeepSeek宣布将其面向华为昇腾平台的基础设施组件进行开源,包括TileLang算子编程语言及其编译支持、计算库和分布式通信库,并指出:“这些组件与之前面向英伟达平台的开源组件完全对应。”

DeepSeek正在系统性地将支撑其模型研发的核心工具和算子能力拓展至昇腾平台。双方的合作已从模型适配层面,深入到训练和推理所需的基础软件优化中。

官方还透露,DeepSeek与华为正共同推进基于昇腾950的128卡超节点方案,并对计算和通信进行了深度优化。

01 让核心研发工具拥有另一条硬件路径

在这套开源组件中,TileLang扮演着最关键的角啬。

在大模型研究中,新想法需通过算子转化为芯片可执行的计算。算子开发越复杂,研究者验证新结构、优化训练效率所需的时间就越长。DeepSeek对TileLang的期望是,让开发者能用更简洁的语言编程,同时保留充分利用芯片性能的能力。

据DeepSeek介绍,与CUDA相比,TileLang能简化代码逻辑、提升开发效率;与其他同类高级语言相比,其编程模型能更充分地发挥芯片特性。这条路径先在英伟达平台上验证成功,目前已承载V4系列模型训练中大部分算子的实现,是DeepSeek开发高性能算子的核心工具。

此次昇腾版本封装了底层的Ascend C指令。DeepSeek称,目前训练中使用的每一个TileLang算子,在昇腾上都有对应的高性能实现。

这一进展的意义在于,DeepSeek能将已熟悉的研发工具延伸到另一种硬件上,减少为不同平台重复开发的负担。昇腾获得的支持,也更贴近模型团队自身的训练需求。

但编程工具只是其中一环,模型还需高效执行具体计算,并在多张卡之间交换数据。

因此,此次开放的组件还包括加速矩阵运算的DeepGEMM、处理跨设备通信的DeepEP,以及覆盖向量计算与访存、稀疏注意力,以及用于注意力索引和采样的Top-K选择等操作的TileKernels、FlashMLA和DeepSelect。它们为常见任务提供可复用的实现,让开发者无需从头逐项优化。

“一一对应”也因此有了实际含义。部分项目已对齐上层接口,例如TileKernels支持同一套Python接口在英伟达GPU与华为NPU上运行,底层实现根据硬件选择。

不过,接口虽可复用,性能仍需针对硬件打磨。DeepSeek在公告中感谢华为团队给予“毫无保留的大力支持”,双方围绕128卡超节点共同优化计算与通信,正是为了让这些软件能力在具体系统中发挥作用。

DeepSeek表示,多项关键测试用例的性能已接近硬件上限。这些成绩虽属特定测试条件下的结果,但表明双方的工作已进入性能深度优化阶段。

此次进展之前,昇腾生态已围绕DeepSeek模型进行了多轮适配。

02 从推理服务,逐步进入模型研发

2025年8月,DeepSeek发布V3.1时,解释其UE8M0 FP8设计面向即将发布的下一代国产芯片。虽然未点名华为,但这一表态说明,国产硬件需求已开始进入模型团队的技术设计考量。

2025年9月29日,DeepSeek-V3.2-Exp发布,引入稀疏注意力机制,并开放相关算子实现。同一天,TileLang-Ascend开源,围绕昇腾建设高级语言开发能力的工作由此公开。

2026年4月24日,V4预览版发布,昇腾适配已延伸至推理和训练侧。开放原子开源基金会披露,相关实践包括推理优化、Ascend C融合算子,以及训练优化和续训练;TileLang-Ascend也发布了V4算子。

此次DeepSeek明确将适配范围对齐自家训练使用的TileLang算子,并将计算与通信组件成套开放,同时披露了与华为围绕昇腾950开展联合优化的进展。

从已发布模型的部署适配,到面向新结构的算子优化,再到此次基础设施组件开放,昇腾对DeepSeek的支持正进一步深入模型研发所需的软件层。

03 扩充算力,需要跨过软件这一关

9月24日,腾讯科技报道,DeepSeek规模为500亿元的第二轮融资已接近结束,但部分审核仍在进行,具体落地时间尚不确定。路透社此前也报道,DeepSeek已聘请中信证券筹备潜在的科创板IPO,上市时间及募资规模尚未确定。

资金可以支持研发和基础设施投入,但新增硬件能否转化为有效算力,还取决于软件适配与运行效率。

据The Information报道,梁文锋在近期投资者会议上表示,DeepSeek将超过70%的算力用于模型训练,留给推理的算力不足30%。这也解释了,为训练所依赖的核心工具增加硬件选择,具有怎样的现实分量。

对DeepSeek而言,昇腾上的工具与组件越完善,未来选择算力平台时,需要重新投入的工程成本就可能越低。对华为而言,与模型团队共同优化,有助于让芯片软件更快跟上模型结构变化,将适配经验用于后续产品。

开源又使这种合作具备向外扩展的可能。DeepSeek表示,希望TileLang昇腾版本能为更多AI芯片建立高可用软件生态起到示范作用。如果其他团队可以复用这些工具,更多国产芯片承接前沿模型的门槛也有望降低。

从组件开源到稳定承担大规模生产任务,仍有工作要做。DeepEP昇腾版还列有开发中的功能,此次公告也未披露V4已在昇腾上完成全流程大规模训练,但可以看出DeepSeek正与华为一起完善一条能够持续支持模型研发的硬件路线。

本文来自微信公众号“腾讯科技”,作者:值得关注的,36氪经授权发布。

更多文章