智谱今日正式发布 GLM-5.3,与前代最大的不同在于——基座模型完全没变,提升全部来自后训练阶段的 Scaling。通过数十倍规模的长程任务环境、更丰富的环境类型以及超长的后训练时间,智谱在相同基座上把模型的智能上界显著抬高。公司内部评测显示,新模型的编程体感较 GLM-5.2 提升约 50%,一跃成为当前编程能力最强的开源模型。
在公开基准上,GLM-5.3 也交出了亮眼答卷。Terminal-Bench 3.0 得分从 4.6 跃升至 28.3,DeepSWE v1.1 从 46.2 升至 66.9,Agents' Last Exam 从 23.8 提到 28.5,GDPval-AA v2 达到 1769 分。其在编程与智能体能力上已接近 Claude Fable 5,体感超过其他国产模型,在 Terminal Bench 3.0 与 Agents' Last Exam(CLI)两项测试中拿下开源第一。

后训练 Scaling:基座潜力远未触顶
智谱强调,上述全部提升均来自后训练而非换模型。基于 IndexShare、SAO 以及持续演进的新一代 Slime 框架,团队在与 GLM-5.2 完全相同的基座上高效推进强化学习,并坦言"可能远未开发出这个基座的智能上界"。这一思路释放出明确信号:大模型竞争未必总要靠堆参数,把已有底座"练透"同样能逼近前沿水平。

在安全维度,GLM-5.3 在白盒代码审查与漏洞发现等任务中表现持平 Mythos 5,展现出面向网络防御场景的潜力。智谱将在发布两周后开放完整模型权重,但前提是完成安全评估与模型加固,以限制潜在攻击能力、保留防御价值。与此同时,新模型即日上线官方编程工具 ZCode、AutoClaw 及 GLM Coding Plan,并面向 Trae、扣子、WorkBuddy / CodeBuddy、Qoder 等编码平台开放抢先体验。当开源模型在编程赛道逼近闭源旗舰,国产大模型的下半场较量,正从"谁更会说话"转向"谁更会干活"。