|
||||||
|
|
|
|
这几年,我一直都在关注国产算力。平时看得比较多的,是华为的昇腾和鲲鹏,还有海光、摩尔线程、沐曦、寒武纪等厂商的芯片。说实话,阿里云的算力硬件,虽然平时也有耳闻,但一直没太关注。
阿里云的玩法,和刚才提到的厂商不太一样。阿里云本身就是云服务商,是甲方,就和运营商一样。阿里云做硬件,主要是自给自足,大部分不对外销售。
换言之,阿里云用自己的硬件,建自己的数据中心(算力资源池),然后以云服务或平台的形式,对外销售(出租)算力。
像华为的话,虽然也有自己的云,但自身主要角色仍然是乙方。他们提供算力软硬件解决方案和产品,卖给云服务商、运营商和政企客户。然后这些客户搭建自己的算力集群和数据中心,跑自己的业务,或者再卖给下游客户。
阿里云的玩法,好处是自产自销,需求明确——云服务部门想要什么产品,技术研发部门就按需求设计,不需要考虑别人的需求和意见。反正性能足够强,自己用起来方便,就可以了。
不对外销售,在生态方面,也不需要考虑太多,能够提供上层业务服务就可以了。
但坏处就是,因为不太面向开放市场,所以不容易卖给别的客户,没办法赚更多的“硬件收入”。从生态的角度来说,相对封闭,外部开发者难以直接基于阿里云硬件进行开发和适配。
如果说华为有点像英伟达的话(卖铲),那么,阿里云就有点像谷歌(自己造铲,自己挖矿)。
这次看云栖大会上的展示,发现阿里云在硬件这块,玩得相当专业。很多硬件的性能指标,已经超过了友商同类产品。硬件的品类丰富程度,也超出了我的意料。
说白了,真的有一种“士别三日,当刮目相看”的感觉。阿里云这个家伙,闷头搞啊搞,突然变出了这么多的自研产品,属实令人意外。
阿里云的AI基础硬件种类太多,加上他们又特别喜欢取各种奇怪的“武侠风”名字,所以,总让人分不清头绪。
接下来,我就给大家做一个阿里云AI硬件产品体系的详细盘点。一方面,方便大家认清楚产品的名字,另一方面,也趁机深入了解一下各个产品的性能和特点。
█ 芯片 阿里云的AI算力硬件基础设施,横向可以分为“算力、存力、网络”三个大类,纵向可以分为“芯片、整机/超节点、整机柜集群”三个层级。
我们先看看芯片。
阿里云的芯片,基本上都依托于平头哥(T-HEAD)。
平头哥,全称是平头哥半导体有限公司,是阿里巴巴集团2018年成立的全资芯片设计主体,有点像华为的海思半导体。
平头哥的自研芯片,是阿里云算力硬件体系的底座,分为数据中心算力芯片+嵌入式芯片(物联网、端侧)两大产品线。
● 真武 数据中心算力芯片中,最重要的主力芯片,就是真武系列AI训练推理一体芯片,可以对标华为的昇腾系列。
真武系列的代表型号,包括真武810E、真武M890、真武V900。
具体参数见下面的表格:
最值得关注的是真武V900。
本届云栖大会上刚刚发布的这款芯片,基于自研并行计算架构设计,搭载216GB大容量显存,片间互联带宽达1200GB/s,芯片原生支持FP8、FP4低精度计算,性能是M890的3倍。
根据阿里云的计划,真武V900将于2027第一季度量产。
真武J900是规划中的下一代旗舰,暂时没有太多信息。
值得一提的是,真武系列的前身是含光系列。代表型号是含光800,属于早期云端推理芯片,面向图像、视频、OCR场景,大规模部署过。
● 倚天 然后,是倚天系列。倚天是Arm系列通用CPU,类似华为的鲲鹏系列。
倚天的代表型号是倚天710、倚天720、倚天730。710已经规模商用,720和730将于明年推出。
据称,倚天720在单核性能、核密度与能效方面都有全面提升。倚天730的话,将首次基于平头哥全自研CPU微架构设计,单核性能将最高提升至倚天710的1.4倍。
未来,阿里云还将推出基于第二代自研核的倚天750。
如果我没记错的话,真武芯片好像是可以直接对外售卖裸芯片的。倚天好像是不行,主要是自用。
● 玄铁 玄铁系列,面向的是端侧和物联网应用,是基于RISC-V架构的嵌入式CPU芯片。这个系列是阿里云平头哥起家的产品,对外直接销售,在国内有很高的出货量,好像是RISC-V处理器中出货量最大的。
玄铁系列包括C系列、E系列、R系列三大产品线。
C系列,是高性能RISC-V,面向高性能计算,用于边缘AI、智能座舱、具身智能、智能视觉。代表型号是玄铁C908、C910、C920、C930(主力服务器级)、C950(旗舰)。
E系列,是低功耗MCU,定位极简、低功耗、小面积,面向嵌入式场景。
R系列,定位硬实时、低延迟、高确定性,面向工业控制、汽车控制、电机驱动等。
● CIPU、磐脉、ICN 刚才说的是算力芯片。平头哥还有通信、存储、安全芯片。
通信的解决方案,要讲一下CIPU、磐脉、ICN。
阿里云前几年提出了CIPU概念,即阿里云自研云基础设施处理器(Cloud Infrastructure Processing Unit)。这个芯片替代传统网卡,硬件卸载虚拟化、网络、存储、安全,降低CPU的负担,也提升整体效率。
CIPU其实有点类似于英伟达的DPU(数据处理单元)和英特尔的基础设施处理器(IPU)。
磐脉,是平头哥自研的智能网卡芯片/网卡硬件,属于网卡ASIC芯片,负责GPU之间海量数据高速传输,主打AI智算集群高速网络(Scale-out组网)。可以对标英伟达的ConnectX系列智能网卡。目前旗舰版本是磐脉920。
阿里云还有非常关键的ICN Switch。
ICN,英文全称Inter-Chip Network,芯片间互联交换(Scale-Up,节点内互联、柜内互联),有点类似华为的灵衢总线技术,以及英伟达的NVLink技术。
ICN Switch 1.0,用在磐久AL128超节点(单机柜128张真武M890,下文会介绍)上,单芯片吞吐25.6Tbps,支持64卡全带宽无收敛互联。
ICN Switch的下一代(2.0?),估计2027年第一季度推出,搭配真武V900和磐久AL64超节点,片间带宽1200GB/s,目标支持千卡级柜域全带宽互联,原生内存语义、统一编址。我记得华为的昇腾950超节点(灵衢2.0)也是支持这些特性。
● 镇岳 存储的话,平头哥有镇岳系列存储主控芯片,代表型号是镇岳510(SSD主控芯片,PCIe5.0,IO处理能力3400K IOPS,时延4μs,基于RISC-V玄铁内核)。
在存储方面,还有AliFlash之类的,以及一些SSD产品硬件。
● 安全 安全的话,平头哥有神盾可信安全芯片,以及独立的TPM/TCM可信平台模块芯片、硬件TEE加密计算等。
█ 整机/超节点 接下来,看看服务器整机和超节点这个层级。
阿里云自研云原生服务器整机品牌叫做磐久,分为通用服务器和AI超节点服务器两大分支。
通用服务器,主要面向云计算、大数据等常规业务场景,包括高性能计算、高性能存储、大容量存储几类,不多介绍了。
重点看AI智算超节点。磐久超节点,包括AL64、AL128、AL144,数字代表了卡的数量。
最新的磐久AL128超节点服务器,内置真武V900、新一代ICN Switch、磐脉智能网卡及镇岳SSD主控芯片,正交无缆化,Pb/s级Scale-up带宽,百纳秒级延迟,单一集群可扩展至50万卡规模,将于2027年第一季度上线。
磐久AL144,阿里云的旗舰AI超节点,主打万卡级Scale Up光互连,单柜最大支持144张GPU(柜内通过正交铜互连,也是Pb/s级Scale-up带宽,百纳秒级延迟),跨柜可扩展至万卡级(通过二级SNPO光互连最大可扩展到10368卡),面向MoE超大模型。
功耗方面,磐久AL144的整柜功耗高达650kW?,最大支持单GPU功耗3500W。
为了支持如此巨大的功耗,磐久AL144采用了800V垂直供电架构?,配合服务器内800V PDB和垂直喷射微通道冷板。这属于全液冷原生设计。
差点忘了,阿里云还有一个磐久CXL内存扩展超节点。
传统服务器的CPU与DDR内存强绑定,内存容量受插槽限制,也会形成资源孤岛。
磐久CXL内存扩展超节点基于CXL 3.1协议做内存池化,把内存资源从CPU解耦,可以构建一个共享内存池,用来解决大模型KV Cache、数据库场景的内存墙问题。
█ 集群 整机/超节点再往上,就是集群层级了。阿里云的完整大规模算力硬件集群系统,被命名为灵骏(Lingjun)。
灵骏的基本算力硬件单元,是磐久AL64/AL128/AL144超节点,这个没啥好说的。
集群关键在于Scale-out网络,也就是节点间的高速互联网络。灵骏集群采用自研的HPN(High Performance Network)高性能网络架构,支持RDMA协议,能够实现万卡规模下的线性加速比,确保大规模分布式训练的高效通信。
HPN有7.0和8.0两个主流版本。
HPN7.0,2023年大规模部署,51.2T以太网交换芯片,网卡以400G RDMA为主,可以构建单层千卡、两层万卡集群,计算网与存储网双平面分离,自研Solar-RDMA+HPCC流控+ACCL通信库,降低AI训练通信延迟和抖动,提升集群整体训练效率。
HPN 8.0,2025年云栖大会的时候发布,配套真武M890超节点,支持64卡超节点Scale-up,支撑Qwen3.8等万亿MoE模型,GPU互联带宽6.4Tbps,存储网络带宽800Gbps。
HPN8.0 pro增强版,单集群可支持13万个800G端口,集群上限达到十万卡级别。
阿里云的自研交换机好像是叫过白虎这个名字,有待确认,官方文件和新闻里好像没有这么写,可能是内部花名。
核心的ASIC交换芯片,阿里云展示了102.4T的产品(UPO,Ultra Performance NPO)。
自研的51.2T路由器,既有128×400G的规格,也有64×800G的规格,可以构建数据中心之间的连接(Scale-Across),为构建更大规模、更高带宽的智算集群提供了灵活的组网选择。
顺便提一下阿里云的光通信技术水平。
阿里云在算力芯片上很强,这也还是可以理解的。但是,本次参观云栖大会,发现阿里云在光通信领域也令人震惊。
首先,800G/1.6T光模块,阿里云都有自研。然后,自研的C+L单波1.6T传输设备,也有。
这几年光通信里很火的CPO(共封装光学)和NPO(近封装光学)技术,阿里云都有深入布局。硅光芯片,阿里云有自研。液冷解决方案,也有研究。
怎么说呢,这几年光通信圈里“易中天”搞得风生水起,股价猛涨(最近跌了)。这么一看,阿里云自研也没差多少。这块能力如果剥离出来,单独成立一家公司,恐怕也能在光通信市场占据一席之地。
你要说华为搞通信出身,光通信技术有深厚积累,是理所当然的。阿里云并不是通信出身啊,怎么就能自研出这么多东西来?反正我是挺佩服的。
集群的存储方面,阿里云有自研的盘古分布式存储系统,还有CPFS(Cloud Parallel File Storage,云并行文件存储)。
这个CPFS是灵骏智算集群配套的集群级共享存储,能够支持大规模AI训练场景下的高吞吐、低延迟数据访问需求。
█ 结语 好啦,以上就是针对阿里云AI算力硬件产品体系的盘点与梳理。一些端侧产品例如无影之类的,还有一些软件生态和平台例如真武PPU SDK、PAI之类的,我就不多介绍了。
我简单画了一张硬件体系图,供大家参考:
总而言之,阿里云作为一个云服务商,其自研算力体系已从底层芯片到上层集群实现了全栈闭环,而且技术水平已跻身全球第一梯队。这确实是非常令人意外,感觉他们平时还是太低调了,突然亮出家底,才让人意识到其技术储备之深厚。
如前面所说,阿里云的这种“自产自销”的模式,有好处也有坏处。坦率地说,小枣君其实更倾向于术业专攻,将产品能力单独剥离出来,孵化成独立的商业实体,面向更多的客户,进而形成更广泛的国产生态,可能会更好。
当然,这也只是我的一家之言。算力、存力和集群通信是一个巨大的市场,国内厂商拥有很大的发展空间。阿里云这种独树一帜的模式,究竟会如何发展,还有待时间的检验。
关于我们 北京汉深流体技术有限公司是丹佛斯液冷产品的核心分销商,专注于为数据中心提供液体冷却解决方案。我们竭诚为人工智能计算集群和高密度服务器场景提供高效的冷却解决方案。我们在2026年会上再获殊荣 —— 成功蝉联丹佛斯动力系统 2025 财年 “卓越成长 业绩突破奖(Performance Outstanding Award)”。这是汉深流体继 2024 财年后再度斩获该奖项,既是丹佛斯对其业绩高速增长、市场拓展能力的高度认可,更彰显了汉深流体在数据中心液冷连接领域的专业积淀与行业标杆地位。汉深产品包括FD83全流量双联锁液冷快换接头(互锁球阀);液冷通用快速接头UQD & UQDB;OCP ORV3盲插快换接头BMQC;EHW194 EPDM液冷软管、电磁阀、压力和温度传感器。在人工智能AI、国家数字经济、东数西算、双碳、新基建战略的交汇点,公司聚焦组建高素质、经验丰富的液冷工程师团队,为客户提供卓越的工程设计和强大的客户服务,支持全球范围内的大批量交付。 公司产品涵盖:丹佛斯液冷通用零泄漏快换接头、EPDM软管、电磁阀、压力和温度传感器及Manifold。 数据中心液冷解决方案 ~ 满足您各种需求的一站式解决方案: 在快速连接器与管路配件领域,英伟达的官方参考设计中主要绑定了丹佛斯Danfoss产品线。这些核心零部件必须在高密度、高振动环境下提供绝对的密封保证: 1、丹佛斯 Hansen UQD/UQDB 系列:作为专为数据中心直接液冷定制的无滴漏快速接头,其通流系数(Cv)超越 OCP 行业标准25% 以上,在降低管路系统功耗的同时提供一键式单手推拉断开功能。其表面采用阳极氧化铝或 SS303/SS316 不锈钢,可承受-40°C至150°C的严苛温度环境。 Bejing Hansen is a core distributor of Danfoss liquid cooling products, specializing in liquid cooling solutions fordata centers. We are deeply providing efficient cooling solutions for AI computing clusters and high-density server scenarios. We won another honor at this annual conference — successfully retaining the Danfoss Power Solutions 2025 Fiscal Year Performance Outstanding Award. This is the second time Hansen Fluid has won this award following the 2024 fiscal year. It not only represents high recognition from Danfoss for its rapid business growth and market expansion capabilities, but also demonstrates Hansen Fluid’s professional accumulation and industry benchmark status in the field of data center liquid cooling connections.Hansen’s products include: FD83 full-flow double interlock liquid cooling quick disconnect couplings (interlock ball valves); universal liquid cooling quick couplings UQD & UQDB; OCP ORV3 blind-mate quick couplings BMQC; EHW194 EPDM liquid cooling hoses, solenoid valves, pressure and temperature sensors.At the intersection of artificial intelligence (AI), national digital economy, East-to-West Computing Initiative, dual-carbon strategy and new infrastructure strategy, the company focuses on building a high-quality and experienced liquid cooling engineering team, providing customers with excellent engineering design and strong customer service, and supporting large-scale global delivery. Count on Danfoss’ data center experience to help lead the future of data center liquid cooling. - Source line solutions: Danfoss Hansen FD83 Series full-flow double interlock couplings
|
|