9月30日,DeepSeek扔出一记重锤,正式开源面向华为昇腾算力平台的全套基础设施组件。TileLang编译工具、DeepGEMM矩阵运算库、分布式通信库,六大组件和之前开源给英伟达的版本一一对应。 懂行的人都知道,英伟达真正难抄的从来不是芯片,而是CUDA,二十年攒下的软件家底,几百万开发者、几百个加速库、写一次到处能跑的开发体验,这些家底还在自我膨胀,越用越好用。 芯片参数可以追,HBM、NVLink、算力规格都有追赶的一天。可软件生态不一样,客户迁移一次要付出的成本,让无数国产芯片死在最后一步。 DeepSeek这次的打法很聪明。它不搞重写CUDA那一套,而是把自家训练推理的全套工具链,原样开源到昇腾上。 最硬的证据是那句话:训练中用到的每一个TileLang算子,在昇腾上都有对应的高性能实现。翻译成人话就是,能训DeepSeek的代码,昇腾上也能跑。 这背后是华为深度撑腰。双方联合打造昇腾950的128卡超节点方案,华为连底层指令接口都开放了,兼顾高级语言开发和手工性能调优,昇腾的软件底座,从这一刻起有了全球头部大模型的背书。 回头看今年4月那一步,DeepSeek V4就是信号。1.6万亿参数的旗舰模型,100%跑在华为昇腾950PR芯片上,技术架构从CUDA全面转向CANN框架。 为了这一步,V4的发布推迟了两个月。DeepSeek和华为、寒武纪磨合数月,英伟达全程没拿到提前适配窗口。 华为950PR不是软柿子。2026年3月量产,算力是英伟达中国合规版H20的2.87倍,CANN Next还兼容CUDA,能直接适配英伟达代码。 黄仁勋在播客里说得很直白,这件事是灾难性的。英伟达的护城河不是GPU算力本身,而是CUDA作为默认起点的软件生态位。 为什么非得是DeepSeek来挖?因为它是全球最头部的大模型厂商之一,它证明了没有英伟达也能训出顶级模型,这一句话比任何广告都有说服力。 开源就是挖墙脚的铲子。开发者跟着工具链走,昇腾上的软件越来越多,CUDA从默认选项变成可选项,写一次到处能跑这句话,不再是英伟达专属。 现实没那么容易。CUDA二十年家底,几百万开发者、无数调优过的算子,不是一年两年能追上,迁移成本这堵墙还立在那里。 DeepSeek和华为这一手,等于告诉全世界,英伟达的软件护城河不再是不可碰的,挖,总比不挖强。 特别