【ALENG 自媒体】9月20日晚间自媒体专稿,过去一周,全世界科技媒体的聚光灯几乎都打在同一个人身上——马斯克和他的星舰、他的芯片厂、他随口喊出的GDP数字。但在上海,另一场更安静也更长线的算力革命,已于9月17日华为全联接大会2026悄然铺开。
华为这次没再讲“单颗芯片有多强”,而是把话头直接甩到了系统层面。副董事长、轮值董事长汪涛在主题演讲里把算力明确定义为华为AI战略的核心,而真正的主角,是业界首个采用NPO(近封装光学)技术的昇腾960超节点。单个超节点可以扩展到4096张NPU,提供8 EFLOPS的FP8算力、最高1PB的HBM容量——数字本身已经够吓人,但更关键的,是它怎么把这些卡“焊”成一台机器。
长期以来,AI集群有个绕不开的尴尬:卡越多,通信越拖后腿。华为给出的口径是,传统服务器架构下,集群内部通信要吃掉超过40%的训练时间,模型浮点算力利用率(MFU)被严重拖累。当十万卡集群已经成为训练十万亿参数大模型的标配,瓶颈早已不在单卡,而在卡与卡之间那根“看不见的线”。
于是华为拿出了灵衢(Lingqu)UnifiedBus。据21世纪经济报道等现场媒体描述,这套总线要把十多种互联协议收敛成单一的内存语义 fabric,互联带宽从100GB级直接拉进TB级,往返时延从约7微秒压到约2微秒,让一个SuperPoD内部实现全局内存统一编址。CPU、NPU、内存、SSD像对等节点一样挂上去,Attention和FFN还能硬件加速解耦——说白了,就是把“一堆各自为战的服务器”重新组织成“一台逻辑上的超级计算机”。
最耐人寻味的突破在光。昇腾960用5500个自研的Hi-ONE光引擎,替代了约4.8万颗传统800G光模块,单引擎传输容量7.2Tbit/s,一举把功耗砍掉超过550千瓦,系统可用度做到99.8%。华为还宣称,一个4096卡的SuperPoD能省下大约196公里铜缆——实打实把铜线从机柜里换成全光互联。这背后的逻辑很清楚:当先进制程被卡脖子,与其死磕单点,不如用光电协同和架构创新,把算力的战场从“一颗芯片”搬到“一整套系统”。
从超节点到超级集群,华为画了一张很大的饼。多个昇腾960超节点通过灵衢网络连接,最大集群规模可达51.2万卡;再叠加上多轨道拓扑,理论上能撑到100万卡。配套还有鲲鹏950与OceanStor M900上下文记忆存储。华为没有掩饰这是一条路线图——ICT BG CEO杨超斌展示的Xinghe UBG交换机标称1024 radix,目标就是为十万亿参数以上的模型预留百万卡扩展空间。
值得一提的是生态侧的拐点信号。据华创证券研报,CANN外部开发者占比已达61%,首次超过内部;昇腾成了PyTorch官网能直接安装的第一个中国算力平台;鲲鹏全球开发者超416万,openEuler装机突破2000万套。与主流开发范式兼容,往往比堆硬件更能决定一个算力底座能不能真正“用起来”。
但冷静下来看,这些仍是厂商自己的路线图宣称。多位分析师也提醒,从“发布”到“独立集群实测”,中间还隔着量产节奏和真实负载的检验;百万卡是目标,不是今天握在手里的现实。昇腾960DT、960PR分别要等到2027年一季度、三季度才就绪,970、980则按“一年一代”往后排。华为把AI算力的竞争维度从单卡抬到了系统级,这一步盯得很准;至于它能不能在中国算力底座上真正跑通,时间会给出答案。
当硅谷还在为单颗GPU的峰值吵得不可开交,上海这场大会给出的答案简单又野心勃勃:未来的算力,或许不属于把一颗芯片做到极致的人,而属于把一百万颗芯片安静连成一体的人。