
字节跳动Seed团队和清华大学智能产业研究院(AIR)联合放出一套新系统——CUDA Agent。这套系统专治一个老毛病:大模型写的代码,语法挑不出错,可跑起来就是慢吞吞,拼不过传统编译器。现在,他们让AI学会了写出更快、更高效的GPU程序,在底层代码优化领域捅破了一层窗户纸。
先解释一下这事的难度。GPU程序员写的那种底层代码,叫“内核”,它直接操控显卡硬件,写得好不好,性能差距能到好几倍。以前大模型也能生成这种代码,但质量堪忧。拿KernelBench这个行业标准测试来说,字节的基础模型Seed1.6,任务通过率其实有74%,但写出来的代码能在运行速度上超过torch.compile(一个普遍使用的编译器)的,只有27.2%。换句话说,AI写的代码平均速度还不如编译器这位“老师傅”自己动手。
那CUDA Agent是怎么逆袭的?简单说,就是让AI像实习程序员一样,真刀真枪地进到实际开发环境里练手。系统给模型配了一整套工具:跑性能分析、检查正确性、还有带权限管控的安全沙盒,干坏事了也不会炸掉整个系统。然后在强化学习算法的驱动下,死磕150步训练,一步步优化自己的代码。
效果确实惊人。同样在250个任务的基准测试里,训练后的模型整体通过率飙到98.8%,而且高达96.8%的生成内核跑赢了torch.compile。意思就是说,AI写的代码,现在大概率比人类精心调优的通用编译器更快,这放在以前是很难想象的。
目前字节和清华没放出完整模型权重,但把训练用的“作业答案”公布了:一个6000个样本的CUDA-Agent-Ops-6K数据集、SKILL.md规范说明,还有奖励机制和热身训练配方。想跟进的研究者和开发者,可以直接拿着这些材料复现研究。
这一技术的应用前景很广,凡是吃性能、看延迟的行业都可能受益。AI基础设施(比如大模型的推理服务)、自动驾驶系统、量化交易这种毫秒必争的场景,都指望着代码跑的每一纳秒都被榨干。这次突破说明AI不只是能聊天画画写文案,还能反过来优化底层计算,把自己的“发动机”调校得越来越快。