原来是美男

芯片卖了56万片之后,阿里平头哥把最值钱的东西开源了_我的网站

名侦探柯南

一 |     闻乐 发自 凹非寺          量子位 | 公众号 QbitAI          如果把AI芯片比作发动机,那AI软件栈就是「变速箱+传动系统+驾驶系统」。

二 |          发动机再猛,传动拉了胯,动力传不到车轮上,车照样跑不起来。         这个道理,做了8年芯片的平头哥比谁都清楚。    2026年8月,人类文明在院线遭遇了一次公开处刑。行刑者不是拍摄宏伟史诗的诺兰,是《牛来》。         WAIC 2026现场,阿里平头哥宣布开源自研AI软件栈T-Head SAIL。         这是其真武系列AI芯片的底层软件,拥有独立的自主知识产权,同时全面兼容主流AI生态,覆盖从OS层、SDK层到接口层的完整链路。

三 |          源码、驱动、工具链、文档一次性摆上桌,全球开发者都可以在平头哥开发者社区下载。1.png你问我《牛来》是什么?哦,就是那头建模像二十年前电脑游戏的神秘黄牛犊,也算史诗吧。         而在开源之前,这套软件栈已经攒下了一份相当能打的成绩单。

四 |          截至今年4月,真武AI芯片累计出货56万片,服务20多个行业的400多家客户。正是这部有点抽象,且最初票房仅有七千块的鬼畜电影,热度碾压了无数耗资过亿的暑期档大热门。3.png一时间内可谓是拳打《奥德赛》,脚踩《蜘蛛侠》,而这酣畅淋漓的过程,我愿称之为——登神长阶。         还在阿里云以及大量行业企业的真实生产环境里跑了很久,扛过双11级别的大规模流量洪峰,也扛过复杂场景和严苛SLA的反复拷问。

五 |          也就是说,平头哥这次拿出来的是自家业务的核心底盘。         所以问题来了,一家芯片公司,为什么要主动拆掉自己的围墙?          AI芯片的胜负手,从来不在硬件          要理解这个动作的分量,首先得理解软件栈在AI算力链条中有多关键。

六 | 第一级台阶,无人问津的修院将时间倒回8月5日。         一颗芯片刚从产线上造出来的时候,对开发者来说其实是不可用的。那天的《牛来》还不似现在这般被万人追捧,甚至可以说是无人问津,像村口那头不知死了多久的老黄牛。         开发者日常写代码用的是PyTorch、TensorFlow这些上层框架,他们不会,也不应该直接去跟芯片底层的电路和指令集打交道。         这中间必须有一整套完整的基础设施来做翻译和调度,把开发者用Python写的几行代码拆解成成千上万条芯片能高效执行的底层指令。因为成本受限,《牛来》零宣发,零预热,海报也相当潦草,整部电影的建模,更是粗糙到像是用工程软件直接拖出来的素材,稍微用点AI都不至于如此稀烂。6.png任何人在手机上刷到它猎奇的画面,都只会觉得:“爱看这玩意的有异食癖吧。         这个桥梁就是AI软件栈。”电影上映9天,票房仅7169元,全国只有两百多个人看过,随便一家蜜雪冰城一天的人流量都比他多。

七 |           作者声明:该图片由AI生成△图片AI生成          用户能看到的只是水面之上的API接口,水面之下是厚厚的算子库、编译器、运行时、驱动层,以及围绕这些核心组件的调试工具和性能分析套件。当然,没人来看这点,也不全是《牛来》的错,毕竟除了质量差这个致命伤,还有同期间王牌对王牌的较量。

八 | 18.jpg当诺兰的《奥德赛》和漫威的《蜘蛛侠》打得火热时,《牛来》安静地躺在院线角落。

九 | 就像隔壁老王和老张吵架时,他们家的黄牛只能呆呆在原地看着一切发生,它不在乎这一切,也没人在乎它。直到奇迹发生了。         只有配合足够强大的软件栈,才可能充分发挥出芯片的算力性能。         然而,现实中的门槛还要更高一层。

十 | 第二级台阶,被看见,然后被围观8月14日,《牛来》"上映9天票房7169元"这个数字,加上那怪奇的画面,像一颗丢进互联网的粪球,啪的一声,炸出了满天稀。门庭冷落的《牛来》,一时间高朋满座,所有人蜂拥而至前往电影院,像是崩赴一场盛大的赤石狂欢。

十一 | 过去很长一段时间里,AI软件栈对大多数开发者来说都是一个典型的黑盒。          作者声明:该图片由AI生成△图片AI生成          芯片厂商交付的是一套编译好的二进制工具链,你只能按照文档给定的方式调用,既看不到内部实现逻辑,也不知道芯片在底层到底怎么跑你的模型。到不是说大家都有异食癖,只是好奇:"这玩意儿到底是有多烂啊"。15.jpg而接下来发生的故事,才是26年8月真正的科幻大电影。《牛来》单日票房从3900元,一路暴涨到35万,不到两天翻了近90倍。累计票房更是破了500万,排片从几乎归零,猛增到上万场,直到笔者写下这篇稿件时,票房已经突破了千万。9.png(甚至各大平台都还没评分)对于一部抽象小电影而言,这太夸张了。         所以一旦遇到性能瓶颈或者兼容性问题,开发者只能提工单等厂商响应。         一个模型迁移项目,动辄要花数周甚至一两个月的时间来回调试,而在这个时间里,模型版本可能已经迭代了两三轮。         时间成本之外,开销成本也足以让人打退堂鼓。短短一个周末,它从2026年院线里最没有存在感的电影,变成全国影院连夜加场的对象。         这也解释了为什么NVIDIA能在AI算力市场上稳坐接近十年。线下如此抽象,线上也不例外。         靠的不只是哪一代GPU的纸面参数,更是护城河CUDA。

十二 | 91个相关话题挂在各大热搜榜上,像献给神灵的一排整齐祭品。10.png就这样,《牛来》成了无数人的观影第一选,在这个诸神争霸的暑期档,一堆影帝的票房拜倒在它的“牛威”之下,而这就叫——牛币驱逐劣币。         开发者十几年积累下来的开发习惯、代码资产、社区经验和工具生态,构成了一道比制程更难跨越的墙。         而CUDA之于NVIDIA,就相当于SAIL之于平头哥。         现在,平头哥决定把这个局面彻底翻转过来,SAIL开源就是主动替开发者拆掉那道墙,把原本黑盒的底层能力,变成了透明可控的白盒。当然,买了电影票的我们也不算亏,因为除了赤石,《牛来》还凭借太过抽象,带我们看了一场教科书级别的“反向发行”。         软件栈开源后,过去只有头部云客户才能接触到的底层能力,现在对任何一个研究团队、任何一个开发者都是敞开的。网友们自发的二创、宣传、自制海报等等,一时间让互联网上各式各样的梗图满天飞,这部看了让人想全自动卸载大脑的作品,却获得满座喝彩。

十三 |          用户可以读源码真正搞清楚芯片的运行逻辑;遇到bug能自己定位甚至直接动手修复;          更进一步,还可以针对自己的业务场景做深度定制优化,毕竟没有人比开发者自己更了解自己的负载长什么样。         平头哥SAIL一开源,开发者的开发效率和技术自主性都同时迈上了一个新的台阶。         无需重写、无需等待、无需绑定          细说平头哥这次开源,对外开放的是一套经过生产环境验证的五层完整技术栈,从最底下的驱动一直堆到最上面的运维工具。4.png(你想牛出什么样的人生)客观来说,其他电影宣发的经费够做十个《牛来》了,但没有水军,没有买量的《牛来》,在发行方全程躺平的情况,靠着网友和影院实现了全自动发行。         最底层是驱动和运行时(Driver & Runtime),这层决定了操作系统能不能识别真武芯片、能不能把计算任务正确地调度下去。7.png(影院里大家自己画的海报)第三级台阶,它是什么,取决于围观的人想看什么你问为什么大家这么疯狂?因为《牛来》的意义早就不是一部抽象小电影,它是2026年互联网的一次集体行为艺术。         PPU Runtime负责管理设备内存、命令队列和计算上下文。         PPU Driver分为用户态驱动(UMD)和内核态驱动(KMD),配合PPU Runtime对外提供统一的设备管理和内存管理接口。你花的30块,并非为了去品鉴某种美味的剧情,而是"我赶上了这趟车"的入场券。

十四 |          这一层是芯片和操作系统握手的地方,也是过去最不透明、开发者最摸不着的地方。13.jpg放映厅里,画面一出的全场爆笑,观影时和朋友的分享,散场后大家的鼓掌,每一个点点滴滴汇聚如同星火般汇聚。这哪里是看电影啊,这分明是一场大型赛博团建。

十五 |          这套驱动和运行时的设计,是真武芯片能够在大规模集群里稳定运行的基础。         往上是编程语言层,开放了C/C++和Python接口。那团建的意义是什么呢?当然是开心啦!14.jpg但这满场的欢笑,真的只有乐子么?不,比起嘲笑,用朝圣来解释这一切,或许更准确。朝圣的对象不是那粗制滥造小电影,而是"我参与了这件事"本身。         看起来是个简单的设计选择,但背后隐含着一个关键判断:          不让开发者为一颗芯片去学新语言、换编程范式,而是与主流生态对齐,让现有代码资产平滑迁移。

十六 | 就像李文亚被围观成电子宠物,就像奶龙从烂梗飞升成名画恶搞——时代需要一个祭品,来安放人们对"精致"的不满。这一次,祭品是《牛来》。         再往上是编译器层,包含Compiler与Debugger两大组件,支持从模型图到可执行代码的端到端编译优化。         对开发者来说,这意味着可以看到编译过程中每一步的中间表示,理解模型在具体场景里是怎么被优化的。         第四层是高性能库,SAIL技术栈里最厚的一块。

十七 |          计算库涵盖线性代数加速库acBLAS、快速傅立叶变换库acFFT、随机数生成库acRAND、稀疏矩阵加速库acSPARSE、深度神经网络加速库acDNN、求解器acSOLVER等全套数学和AI基础库。

十八 | 2.png第四级台阶:悲悯的底色《牛来》,喜剧的内核不是别人逗你笑,而是你坐在那自己就想笑,导演对喜剧的理解远超周星驰,沈腾之流。没有复杂的包袱,没有刻意地逗笑,没有高深的技巧,导演质朴、纯粹、摆烂的心态竟然无意中洗刷了人们浮躁的内心。         这些库的每一行代码,都针对真武芯片的底层架构做了精细优化,确保常用的AI计算操作能以最高的效率执行。

十九 | 刻意反转的剧情,频繁高调的宣发,动辄过亿的制作,顶流明星的阵容……背离正常的商业操作常理,也许并不需要过度地迎合、夸张的成本,大道至简,主创直接开出了最简单的药方,看似荒诞,而真正荒诞的从来不是这部刚上映的电影,而是由来已久的人心。         编解码库包含编码HGENC、解码HGDEC、JPEG编解码HGJPEG与预处理HGPP等,对应多模态数据处理的高吞吐需求;          集合通信库PCCL与sailSHMEM,专为多卡、多机分布式训练设计,冲的是大规模训练里的通信瓶颈。

|          此外还配备了acext扩展库与HGML机器学习库,继续拓宽功能边界。         最顶层是开发工具层,Asight Compute做算子级的精细性能分析,用来定位微观瓶颈;Asight Systems做系统级全栈Profiling,提供宏观视角;          PPU-SMI负责设备的实时监控与管理;PPU-DCGM则支撑集群级别的资源智能调度。或许大作并没有被按在地上摩擦,或许是行业那块“票房能象征一切”的遮羞布终于被扯下,又或许大家终于明白"投入越大,赢面不一定越大"的道理......如此这般,每个人的感悟可能都有很多,也都各不一样。

| 16.jpg我们普通观众买票,也不是来鉴赏电影艺术的。         单卡上抠算子性能,千卡集群上盯资源调度,两头都有称手的工具。

| 就图进电影院,跟一屋子陌生人一起看这头黄牛,集体哄堂大笑。         不过对绝大多数开发者来说,比「全」更要紧的是「迁移成本」,平头哥给出的答案是三个无需妥协。         首先是无需重写代码。         SAIL兼容主流AI生态,主流模型即开即用,算子库完整对标,主流编程模型高度兼容。看完出来还能跟朋友吐槽玩梗,几十块钱买份集体乐子,怎么算都不亏。

|          开发者过去积累的经验、写下的代码、攒下的调优技巧在SAIL上都能直接复用。当然热度总有消退的时候,再过段时间,这头全网爆火的黄牛,大概率也会慢慢淡出大家视线。         其次是无需等待适配。         AI技术的迭代速度有多快不用多说,一个新模型出来,社区的适配往往是以天计的。         SAIL这边,平头哥自研的推理引擎提供开箱即用的生产级性能,同时已经建立起与主流社区同频的响应机制。但问题来了,如果现在有一张票放你手上,你会选择冲进影院,亲眼打卡这头传奇神牛吗?。         目前对主流AI推理框架的平均适配时间小于7天。         这个速度基本意味着,社区那边的热度还没过去,开发者在真武芯片上就已经能跑了。

|          而且无需自己额外做适配和调优,就能用上最新的算子、特性与优化手段。         最后是无需绑定框架平台。         SAIL已经全面适配PyTorch、TensorFlow、vLLM、SGLang等260余个主流训练与推理框架,工具链也支持按需灵活选用,不绑定任何特定技术路线。         这一条其实最见格局,SAIL明确把技术选型的自主权留给开发者,开发者也不必担心被锁死在某个封闭生态里。         不重写、不等待、不绑定,用开放换取信任,用兼容降低门槛,T-Head SAIL把迁移的摩擦力尽可能降到了“零”。

|          平头哥的全栈牌局          其实再把视线拉远一点会发现,SAIL开源是平头哥8年布局走到今天的一个必然节点。         2018年,平头哥成立时AI芯片赛道已经挤满了玩家,外界对它的初始印象大抵是“阿里内部的一个芯片孵化项目”。         但平头哥在阿里内部的待遇从来不普通,芯片这块最难啃的骨头一直享受着饱和式投入的待遇。         高强度的研发投入,加上与阿里云、大模型等核心部门的紧密协同,让平头哥以一种闷声干大事的节奏,成长为中国芯片产业链里最大的黑马。         2019年,成立仅一年的平头哥推出第一颗芯片含光800。         这是一颗针对AI推理场景深度定制的芯片,采用自研架构、推理性能达到78563 IPS,也就是每秒可处理7万8千张图片,一举拿下当时同类芯片性能与能效比的两项第一。         随后含光800逐步应用于双11淘宝主搜场景,在真实流量中完成检验。         紧接着,平头哥把目标投向了难度更高、通用性更强的CPU赛道。         2021年云栖大会上,倚天710正式亮相,这是阿里体系内第一颗通用服务器CPU。         阿里由此成为首家具备CPU研发设计能力的中国互联网公司。         这颗芯片性能超过同期业界标杆20%,能效比提升超过50%,如今已通过阿里云大规模应用于视频编解码、高性能计算、游戏等领域。         而在通用AI芯片这条最考验综合能力的主跑道上,平头哥的步伐同样扎实。         真武810早在2022年底、2023年初就已经完成了研发和场景验证。         它采用并行计算架构和片间互联技术,配备96GB HBM2e内存和700GB/s片间互联带宽,支持PCIe 5.0×16接口,功耗控制在400W,配合全栈自研软件栈实现了从硬件到软件的完整自主可控。

|          阿里已将其大规模用于千问大模型的训练和推理,外部客户也将其部署在各种AI推理和训练的产线上。         到了今年的2026阿里云峰会,平头哥亮出了新一代训推一体AI芯片真武M890。         这颗芯片内置144GB显存,片间互联带宽提升到800GB/s,整体性能是真武810E的3倍。         更重要的是,M890原生支持从FP32高精度训练到FP4低精度推理的全场景覆盖。

|          再加上自研的ICN Switch 1.0芯片,可实现64卡全带宽互联,显著提升大规模智算集群的计算效率与稳定性。

|          到这里,平头哥的芯片版图已经非常清晰了。         算力维度,有真武系列AI芯片和倚天系列Arm服务器CPU,一个打AI,一个打通用计算。         网力维度,有ICN Switch互联芯片和磐脉系列智能网卡,负责大规模集群内部的高速数据交换。         存力维度,有镇岳系列存储主控芯片,例如对标业界标杆三星旗舰的SSD主控芯片镇岳510,满足AI训练推理对低延时、高带宽存储的需求。         算力、网力、存力,这数据中心的三件套,平头哥全部实现了自研。         放眼整个中国芯片行业,能做到这一点的企业,用一只手就能数得过来。

|          恰恰是在硬件布局已经相当完整、产品力已经充分验证的这个节点,平头哥走出了关键破局的一步棋,开源AI软件栈。         56万片出货、400多家客户已经足够证明产品力,但止步于此,终究只是一家芯片供应商。         要建一个真正的芯片生态,应该让开发者可以基于你的平台做创新、研究机构能用你的工具链产出、产业伙伴围绕你的技术栈开发解决方案。         开源软件栈的本质,就是先降低开发者的使用门槛,再把建设的权利也一并交出去。

|          平头哥在这次开源中提出将与全球开发者、科研机构及产业伙伴一起,共同打磨工具链、丰富算子生态、优化性能体验。         落点在共同两个字上,依托经过真实业务验证的成熟算力底座,生态的后续拓展交由全行业协同完成。         某种意义上,这也是国内AI算力生态最缺的一环,国内硬件追赶力度充足,但软件生态积淀不足;          生态的厚度需要时间,更需要先有人敞开技术大门,吸纳全行业力量共建。

|          最后回到名字本身,T-Head SAIL中的SAIL,全称是Seed of AI Library。         用平头哥自己的话说,他们把每一行开源代码都视作一颗蕴含无限可能的种子,期待未来国内AI生态能在共建中蔚然成林。

Current article:http://da3.ninyakenhongnian.sbs/list_9zr6bq/6n4we.html

Published on:10:51:10


关于我的网站 | 我的网站动态 | 联系我们 | 法律声明 | 我的网站员工 | 我的网站邮箱 | 网站地图

我的网站版权所有