2026
09/21
17:40:42
分享
华为的百万卡逻辑:从堆算力到组织算力

  AI越往上生长,越需要更厚的黑土地。

  文 | 华商韬略 张静波

  2026年9月17日,上海,华为全联接大会2026。

  华为副董事长、轮值董事长汪涛发布昇腾960超节点:4096卡规模,8 EFLOPS FP8算力,1PB HBM容量,并首次在超节点中采用NPO光互联技术。

  这是一个面向AI时代的新型计算系统。

  但如果只是把它理解为一台更强的AI服务器,可能低估了这场发布的意义。

  因为昇腾960超节点真正关注的,不是如何制造一张更强的卡,而是一个正在困扰整个AI产业的难题:

  模型越来越大、卡越堆越多,有效算力却没有跟上。

  【01 当堆卡不再等于堆算力】

  过去几年,AI产业遵循一个极其简单的线性逻辑:模型规模扩大,需要更多算力;算力不足,就堆更多卡。

  但大模型正在把这条路推向物理极限。

  模型参数正快速迈向10万亿级,到2030年可能达到100万亿以上;中国每天推理Token需求已增长到500万亿级,未来将迈向百万万亿级;智能体(Agent)也将从今天连续工作几个小时,走向以月为单位执行复杂任务。

  AI吞噬算力的速度,超过了历史上任何一次技术革命。

  于是,产业开始疯狂堆算力:千卡、万卡、十万卡,甚至百万卡。但一个新的矛盾随之出现:算力规模越大,有效利用算力反而越难。

  原因不在卡本身,而在卡之间。

  传统AI集群,本质上是一群独立服务器通过网络协作。每台机器拥有独立的计算、内存和存储,机器间需要频繁交换数据。

  当规模扩大到十万卡级别,通信、同步、数据搬运开始成为致命瓶颈。数据显示,传统10万卡集群中,卡间通信可能占训练时间40%以上。

  汪涛给出的数字更直观:“现在MFU(模型浮点算力利用率),一个10万卡的集群业界往往连30%都不到。”

  这意味着,AI产业正在撞上一堵新的墙。过去,大家担心没有足够多的算卡。现在的问题是:

  拥有更多卡,并不等于获得更多有效算力。

  【02 百万卡时代,如何组织算力】

  一台计算机,到底可以有多大?

  过去几十年,这个边界一直很清楚。一台服务器就是一台计算机;多台服务器连起来,叫集群。

  但当算力走向十万卡、百万卡,传统架构开始撞上高墙:机器越多,通信、同步和数据搬运的成本越高。

  问题从如何获得更多算力,变成了如何组织更多算力。

  过去,是让一群计算机通过网络协作;现在,是让它们在逻辑上更像一台更大的计算机。

  这就像仓库调货,统一内存寻址,就是给所有仓库编上同一套货架号,机器仍然分散,资源却开始像一个整体。

  这个方向也不是华为的一家之言。

  WAIC 2026期间,鹏城实验室和全球计算联盟联合38家单位发布《超节点定义与实践白皮书》,给超节点立了标准:

  具备跨物理节点的统一内存编址能力。

  昇腾960超节点,是这套思路的最新落地。它的价值不只4096张卡,而在于华为把过去分散在计算、光通信、网络、存储和软件里的能力,拉进了同一个AI计算体系。

  这件事,最难的是咬合问题。

  算力单元快了,互联可能成为瓶颈;互联解决了,内存和存储又可能成为瓶颈;机器继续扩大,功耗、散热、可靠性和软件调度接着冒出来。

  AI正在把过去分属于不同产业的技术边界一层层打穿。

  最典型的是光。

  随着高速互联继续升级,铜互联逐渐逼近极限,速率到224G以上,数千根铜缆捆在一起,信号质量和工程安装都成了灾难。

  为此,华为把30年的光通信积累带进计算。

  昇腾960采用Hi-ONE NPO光引擎,把电信号转成光信号的位置进一步靠近卡。

  一个Hi-ONE的传输容量达到7.2T;整个昇腾960超节点用约5500个Hi-ONE,替代传统方案约4.8万颗800G光模块,功耗降低超过550千瓦,系统可用度达到99.8%。

  但光解决的只是互联。

  Agent又提出了新的问题。AI推理需要NPU,复杂任务执行需要CPU,长上下文又需要越来越庞大的KV Cache。

  于是,鲲鹏和存储也被拉进同一个体系。

  基于灵衢全光组网,鲲鹏超节点最大支持4096节点,形成256TB统一内存池;OceanStor M900承担PB级KV缓存。再往上,多个昇腾、鲲鹏和存储节点通过灵衢连接,相关集群架构最大支持向百万卡规模扩展。

  这时候再看昇腾960超节点,逻辑已经完全不同了。

  它不再只是多放一些卡,真正的考验在于,能不能把计算、光、通信、IP、内存、存储、网络和软件,变成一套彼此协同的系统。

  这背后,需要复杂的多学科的系统工程的能力。

  而华为过去几十年,用范弗里特弹药量,围着一个城墙口砸出来的,正是把分散的能力聚成系统。

  汪涛将它概括为一句话:“把这些能力全聚成系统工程能力。”

  结果已经可以部分量化。

  华为马尔科夫实验室仿真显示,同样是10万卡规模,采用4K超节点组成集群,相比传统8卡服务器集群,MFU可以提升2.75倍。

  截至目前,昇腾超节点已经规模商用超过1000套。

  这才是昇腾960超节点真正释放出的信号:

  单卡依然重要,它决定算力的起点。但进入十万卡、百万卡时代之后,最终能释放多少有效算力,越来越取决于整个系统。

  AI基础设施正在从比拼单点性能走向系统工程,从制造算力走向组织算力。

  这,才是华为押注百万卡时代的技术逻辑。

  【03 向下,深耕硅基黑土地】

  解决算力问题,只是第一步。

  更值得追问的是:当AI巨头纷纷向大模型、Agent和应用入口靠近,为什么华为反而选择留在更底层的算力基础设施?

  答案,就藏在硅基黑土地的定位里。

  今天的AI产业,有一种明显的向上冲动:算力厂商想碰模型,模型公司开始做Agent,Agent又争夺应用和用户入口。越接近用户,商业故事越性感。

  华为却给自己画了一条边界。汪涛表示:“所有的核心是为了提供算力,而不是应用。”

  他还有一句更形象的话:“华为磨好我们的豆腐,做好算力底座。”

  而基础设施真正的价值,从来不只是自身能力有多强,更在于有多少伙伴愿意在上面创造价值。

  这也解释了华为AI战略看似矛盾的两面:一边坚持硬件变现,一边坚持开源开放。前者划定华为的商业边界,后者扩大这片土地的生态边界。

  开源开放四个字背后,是真金白银的八年。

  经过八年建设,目前CANN外部开发者占比已达61%,社区月活开发者突破5200名;基于昇腾+CANN的原生训练模型已超过40个,昇腾已进入PyTorch、Triton、vLLM、veRL等90多个主流第三方社区。

  另一边,鲲鹏全球开发者超过416万,合作伙伴7200家。openEuler装机量2000万套,拿下中国服务器操作系统第一份额。

  其中一个很小,却很关键的变化发生在PyTorch。

  过去,开发者获取昇腾相关技术栈,需要从PyTorch社区再跳转到华为社区。现在,昇腾已成为PyTorch官方支持的技术路线。

  这件事没有4096卡那么醒目,却可能更加接近生态竞争的本质。

  因为基础设施做到最后,拼的不只是机器能不能跑,还要看开发者愿不愿意来,模型迁移麻不麻烦,软件工具顺不顺手。

  汪涛因此判断:“经过八年的努力,昇腾生态跨过了拐点。”

  而检验一片黑土地最直接的方式,是看上面长出了什么。

  中国商飞用昇腾和昇思MindSpore做民机设计,中国气象局用鲲鹏支撑数值天气预报,德赛西威则把昇腾超节点用于具身智能。

  从飞机设计、天气预报到工业机器人,应用越往上生长,华为的角色反而越清晰:硬件解决能不能算,生态解决谁愿意来算。

  这或许才是硅基黑土地真正的商业逻辑:华为不包办上层的智能,它要做智能生长的基础设施本身。

  【04 尾声】

  回头看,昇腾960只是华为AI战略落下的一颗棋子。

  “超节点+集群”,解决如何组织算力;系统工程能力,回答华为凭什么组织算力;开源开放,则决定这套基础设施能否成为产业共同使用的底座。

  汪涛说:“每家企业坚持自己擅长的赛道,客串是没有长期竞争力的。”

  这句话,也解释了华为在AI浪潮中的选择。

  当整个AI产业都在向上争夺更大的模型、更强的Agent和更近的应用入口,华为选择继续往下扎。

  磨好自己的豆腐,把算力底座做厚,让伙伴放心去用,为世界构建新的选择。

  越是宏大的技术革命,越不可能由一家公司包办。

  正如汪涛在大会主题演讲中表示:

  “人工智能也许是人类社会最后一次技术革命,它带来的变革之深、之广、之快,远超想象,没有任何一家公司能独自支撑整个智能世界。”

  AI越往上生长,越需要更厚的土地。这,才是硅基黑土地真正的战略含义。

华商韬略
市值观察号
客服号
联系我们
地址:
北京市朝阳区甘露园南里25号国际创展中心20层 2006-2008
电话:
010-8559 2899
传真:
010-8559 2799
邮箱:
hsmrt@hsmrt.com
华商韬略(北京)国际文化传媒中心
版权所有 违权必究
京ICP备07007063号-2 京公网安备11010502020639