
8月14日,智谱发布了新一代大模型GLM-5.3。一个有意思的细节是:它的基座参数量依然是7400多亿,跟上一代GLM-5.2完全同一个底子,此前传得沸沸扬扬的“万亿参数升级”并没有出现——那张牌大概被智谱捏在手里,留给了未来的GLM-5.5。
但别急着失望。智谱靠着一手“后训练”的功夫,硬是把GLM-5.3的性能比上一代拉高了50%。在多项主流基准测试中,它拿下了当前开源模型的最高排名,编程与智能体能力逼近Claude Fable5,编程的实际体验甚至超过了其他国产模型。
几个关键数字最能说明问题。在衡量模型于真实终端环境中完成复杂任务的Terminal-Bench3.0上,得分从4.6一口气蹿到28.3,涨了整整6倍。聚焦长程软件工程与持续代码修改能力的DeepSWE v1.1,从46.2涨到66.9。覆盖多类真实专业场景、强调跨工具协作与长程任务的Agents’ Last Exam,从23.8提升到28.5。在涵盖44种职业、考察真实高价值知识工作的GDPval-AA v2中,GLM-5.3拿到1769分,展现出从编程能力中涌现出的专业任务执行力。
最能体现这次进步的是智谱自研的Z.ai Code Bench。这套评估方式把模型扔进真实的本地开发环境,在不同“思考档位”下执行端到端任务,尽量还原开发者实际使用Coding Agent时的真实感受。结果很有意思:GLM-5.3在效果和Token利用率之间找到了更好的平衡——High档位下准确率达到31.4%,超过了Claude Opus4.8最高档位的29.5%。更关键的是,每项任务平均只输出约5万tokens,而Opus4.8需要约12万tokens。换句话说,GLM-5.3能用更短的执行路径走完同样的事,省下的token就是省下的钱和时间。
产品落地也没拖沓。GLM-5.3即日起上线智谱官方编程工具ZCode和效率工具AutoClaw,同时开放给GLM Coding Plan全量用户及订阅用户。TraeWork、TraeCode、扣子、WorkBuddy、CodeBuddy、Qoder、QwenWork、CatPaw、JoyCode、OpenCode等第三方编码平台也开放了抢先体验。API很快上线,完整模型权重将在两周内完成必要的安全加固后开源——智谱的策略很明确:在开源的同时,尽量限制模型的潜在攻击能力,同时保留其防御价值。今天13:00,GLM Coding Plan全员额度已经重置,所有用户后台的用量统计都能看到额度回满。
这次发布透露出一个清晰的信号:大模型的竞争已经告别了单纯拼参数规模的阶段。智谱给出的路径是——用同样的底子,靠后训练把性能榨出50%的增量。如果这条路走得通,那GLM-5.5带着万亿参数登场时,能跑到什么高度,确实值得期待。