
3月份,阿里巴巴达摩院悄悄发布了一颗名为玄铁C950的服务器级CPU。最近,这颗芯片干成了一件此前RISC-V架构从未做到的事:不插显卡、不加模拟层,纯靠CPU自己,跑通了270亿参数的通义千问大模型。
这个数字什么概念?市面上常见的显卡显存也就8GB到24GB,想跑270亿参数的大模型,通常得备上16GB甚至24GB的独立显存。但玄铁C950偏偏不按套路出牌——它用台积电5nm工艺造出来,集成64个计算核心,主频最高能冲到3.2GHz,把矩阵运算和向量运算的加速引擎直接焊在了芯片里。64个核心按每8个一组,用AMBA CHI高速总线连起来,访存带宽比上一代玄铁C920翻了4倍多。单核跑分在SPECint2006基准测试里突破70分,直接刷新了全球RISC-V芯片的性能纪录。
实际跑起来效果如何?玄铁C950驱动通义千问3.8-27B模型时,解码速度能到每秒30个Token,首Token延迟控制在1.9秒以内。翻译成人话就是:你问它一个问题,不到两秒钟它就开始往外蹦字,回答起来跟普通聊天似的,一点不卡壳。全程CPU和片上加速引擎自己就把活干完了,外接显卡这种累赘配置,直接省了。
这个突破真正值得玩味的地方在于芯片架构的底层逻辑。x86和ARM架构的芯片,厂商要付高昂的授权费才能用,而且想做定制化改动,门都没有。RISC-V是开源的,相当于给了阿里一把万能钥匙——玄铁C950的指令集、核心设计、加速引擎,全是自家说了算。再加上通义千问模型也是自家养的,云计算基础设施也是自家搭的,从芯片设计到模型推理,整条链路都在自己手里攥着。
这种垂直整合的想象力在于:以后模型里的算子可以照着芯片的脾气专门设计,下一代芯片也能根据真实跑模型时的数据反馈,定制专属指令集。AI基础设施的玩法,可能要变天了。
芯片厂商想追上这波节奏,光堆算力可不够,得先想清楚一个问题:你的芯片,能跑自家的模型吗?