9月22日的2026云栖大会上,阿里平头哥发布了新一代训推一体AI芯片——真武V900,搭载216GB大容量显存,片间互联带宽达1200GB/s,单芯片性能是真武M890的3倍。

单就参数来看,真武V900可以说是目前算力性能最强的中国自研AI芯片。可如果只盯着AI芯片,可能会低估平头哥的算力野心。

和真武V900一同发布的,还有基于真武V900和自研ICN Switch互联芯片的超节点,具备原生内存语义和内存统一编址能力,可实现千卡全带宽高速互联,让上千颗真武V900能像一颗“超级芯片"一样协同工作,为超大参数模型的训练和推理提供高吞吐、低延迟、高并发的算力。

以及阿里全新升级的超节点服务器,将真武V900、ICN Switch、磐脉智能网卡及镇岳SSD主控芯片进行了算、存、网全栈系统级协同,通过阿里云的智算中心网络架构,可稳定支撑50万卡规模单一AI集群。

在成立的第八个年头,一直保持高强度、高频率迭代节奏的平头哥,终于亮出了全栈布局的底牌。

一颗“中国最强AI芯片”

真武V900的发布在预料之中,也在预期之外。

2024年,平头哥推出了首颗训推一体AI芯片真武810E,采用自研的并行计算架构和片间互联技术,配合T-Head SAIL软件栈,有效支撑了千问系列大模型的训练和推理。

2026年5月的阿里云峰会上,真武M890芯片首次亮相,显存容量达到144GB,片间互联带宽提升至800GB/s,性能是真武810E的3倍,并支持FP32到FP4多种数据精度。

仅仅四个月后,真武V900再次把性能推高到M890的3倍,显存从144GB增加到216GB,片间互联带宽则800GB/s提升到1200GB/s,时间比外界预期大幅提前。

不惜打破常规的研发节奏,和AI产业的演变趋势不无关系。

时间来到2026年9月末,万亿参数大模型已经是一种常态,有望在极短时间内出现5万亿乃至10万亿参数的“超大模型”。模型参数倍增的同时,MoE几乎成了所有主流大模型的技术架构。

不同于所有参数都参与计算的稠密模型,MoE通过“稀疏激活”,让每个Token只调用部分“专家”,能够在扩大模型参数规模的同时,把单次推理的计算量控制在相对有限的范围内。

代价则是更复杂的通信。

在计算集群中,“专家”往往分布在不同AI芯片上,每个Token都要根据路由结果,将被动态发送给对应的专家,计算完成后再重新汇集,由此产生了大量All-to-All通信。如果AI芯片的带宽和时延跟不上,“专家并行”模式的计算收益可能被通信开销抵消。

2026年以来的Agent浪潮,进一步改变了推理负载。

Agent在执行复杂任务的过程中,可能经历规划、推理、调用工具、读取数据、再次推理等几十轮循环,上下文窗口突破百万级,导致KV Cache不断膨胀。再加上多Agent协同带来海量并发请求、数据中心训推分离的架构设计,数据开始越来越频繁地跨越计算资源流动。

衡量算力基础设施性能的核心公式,由过去单一的算力指标,变成了“算力×内存×互联”。

真武V900的升级,对应的恰好是三个方向:原生支持FP8、FP4低精度计算,可显著降低推理成本;216GB显存,增加了单卡能够承载的模型和数据规模;1200GB/s片间互联,旨在缓解大规模并行计算的通信压力。

平头哥想证明的,绝不是在实验室里跑出一组漂亮数字。

按照阿里官方公布的数据,目前真武系列芯片已经服务超过650家企业客户,覆盖智驾、金融、基模、具身智能、能源、制造等行业。阿里巴巴集团CEO吴泳铭在云栖大会的演讲中表示:“由于平头哥芯片产品线的成熟和客户的广泛应用,平头哥的年出货量将大幅提升。”

一个“真超节点”

提升单卡的“算存互联”性能,只是第一步。

一个万亿参数的MoE模型,通常需要几十张、几百张甚至上千张算力卡,真正决定系统效率的,是不同算力卡能否高效交换数据。

超节点因此成了当下最热门的概念之一。

可什么是超节点呢?把128张、512张甚至1000张算力卡用高速网络连起来,就能叫“超节点”吗?

在理解这个概念前,先分清两个容易混淆的名词——Scale-up和Scale-out。英伟达给出了很直观的定义:Scale-out负责连接数据中心里的不同服务器;Scale-up要让同一个集群里的算力卡像一个统一的计算引擎。

所以说,超节点不是“把更多卡连起来”,需要跨越三道门槛。

第一道门槛:内存语义。

在传统的TCP/IP通信中,节点间的数据交换必须经过繁琐的“发包、封包、路由、解包、收包”机制。

对于需要微秒级响应的AI计算,数据来回交换的通信开销是不可忍受的。超节点的第一要义正是彻底摒弃消息语义,走向更底层的Load/Store级内存直接访问,让芯片A读取芯片B显存中的数据,像读取本地内存一样。

第二道门槛:统一编址。

物理上连接起来,不等于逻辑上是一台机器。

倘若几百上千颗AI芯片拥有各自独立的资源空间,仍需要处理复杂的数据放置、资源访问和跨节点通信。统一编址进一步把物理上分散的资源抽象为统一资源空间,降低大规模并行计算时资源访问和编程的复杂度。

第三道门槛:全带宽高速互联。

8张卡的高速互联并不难,难的是规模从几十卡扩大到几百乃至上千卡后,依然能够保持足够高的带宽、低时延和稳定通信。

平头哥给出的答案是自研的ICN Switch互联交换芯片。

其中真武V900通过ICN Switch互联芯片连接后的超节点,具备原生内存语义和内存统一编址能力,可实现千卡全带宽高速互联,同一套架构可覆盖从单机8卡到千卡集群的全场景部署,为超大参数模型的训练和推理提供高吞吐、低延迟、高并发的算力。

在真假超节点鱼龙混杂的局面下,平头哥发布了一个“真超节点”。

可以佐证的是:目前真武超节点实例已经规模化商业落地,是国内首个跑通Qwen3.8、Kimi K3两大超2万亿参数模型的超节点。

当然,背后离不开阿里云沉淀多年的工程能力,通过从芯片到云平台的全链路优化,显著提升了真武超节点实例的推理效率。比如通过算子优化和软硬件架构协同,在Agentic推理场景中最多可实现1.5倍的性能提升。

一套“为AI而生”的计算系统

把上千颗AI芯片变成一颗“超级芯片”,依然不是终点。

很长一段时间里,数据中心产业建立在高度标准化的分工上:CPU、GPU、网卡、SSD等来自不同供应商,通过PCIe、以太网等标准接口组装成服务器,再由一个个服务器组成计算集群。

到了Agent时代,过去习以为常的范式,渐渐出现了裂痕。

以Agent的运行为例,并非是简单地把问题交给大模型、等待推理结果,涉及CPU、GPU、网卡、SSD等不同模块的协同。

模型推理时,需要AI芯片提供算力;多专家并行计算,需要跨芯片的高速互联;模型权重、企业数据等内容,要不断从存储系统中读取;任务规划、状态管理、工具调用等工作,还要交给CPU处理。

任何一个环节跟不上,都将拖慢整个任务的效率。

回头再看平头哥过去八年的布局,会发现一个有意思的变化:陆续推出了倚天系列服务器CPU、真武系列AI芯片、ICN Switch互联芯片、磐脉智能网卡和镇岳SSD主控。以前像是一条条独立的产品线,放在Agent的任务流里,形成了有序的分工协作。

倚天CPU负责通用计算和Agent调度,真武训推一体AI芯片负责大模型训练与推理,ICN Switch负责超节点内的高速互联,磐脉智能网卡负责更大规模集群间通信,镇岳SSD主控把存储I/O接进整个系统。

有别于“组合采购”的标准化协议制约,平头哥的算、存、网全栈布局,为模型、芯片、云的协同优化提供了基础。

比如在2026年4月,平头哥发布了旗下首款智能网卡磐脉920,不仅提供最高400Gbps的网络吞吐,还在芯片内部集成了PCIe Switch,让AI芯片、网络与存储间的数据搬运进一步缩短路径。

放在传统服务器里,网卡主要解决“怎么把数据传出去”;到了大规模AI集群里,开始参与到整个数据流的调度中,尽量减少CPU在数据搬运上的额外开销。简而言之,平头哥正在把网络从“连接设备”,变成计算系统的一部分。

再比如平头哥在2026云栖大会上首次公布了倚天服务器CPU的后续规划:2027年将推出倚天720和倚天730,未来还将推出基于第二代自研核的倚天750,将支持平头哥自研ICN片间互联总线协议,让倚天CPU与真武AI芯片通过ICN总线直接互联。

不难发现,平头哥的思路已经越来越清晰:不再分别把CPU、AI芯片、网卡和存储主控做强,正在将原本独立的芯片,围绕AI任务协同优化;不再是一组组彼此独立的产品,而是一套为AI而生的计算系统。

写在最后

八年前平头哥创立时,外界对一家互联网大厂能否做好芯片多有存疑;八年后的云栖大会,平头哥用一套覆盖CPU、AI芯片、交换芯片、智能网卡到存储主控的系统级布局给出了答案。

当模型参数向数万亿MoE迈进、复杂Agent任务重塑数据流向,传统“积木式拼凑”的服务器架构正逼近物理与通信的瓶颈。平头哥亮出了真武、倚天、磐脉、镇岳与ICN互联构成的全栈底牌,把目标从“造出一颗更强的芯片”,推向了“造一个更高效的计算系统”。

特此声明
本文为正观号作者或机构在正观新闻上传并发布,仅代表该作者或机构观点,不代表正观新闻的观点和立场,正观新闻仅提供信息发布平台。
分享至

还没有评论,快来抢沙发吧!