GLM-5.3发布:基座未变、编程提升50%,后训练红利下的开发者新机会

AI行业观察GLM-5.3发布openstarry.com

时隔两个月,GLM-5.3来了

8月14日,智谱正式发布了新一代基座模型GLM-5.3。

最让人意外的是:GLM-5.3与GLM-5.2共用同一个基座模型,所有性能提升全部来自后训练Scaling。

智谱官方在发布公告中这样描述:

“通过极致的后训练Scaling大大提高了模型的智能上界:数十倍的长程任务环境、更丰富多样的环境类型、超长的后训练时间。我们发现充分的模型后训练涌现出超出预期的模型能力。”

这说明什么?基座决定下限,后训练决定上限。 在同一套基座上,通过强化学习与长程任务训练,仍然可以持续挖掘出巨大潜力。

对于开发者而言,这不仅是智谱的一次技术升级,更是一个信号——当基座模型趋同时,后训练正在成为真正的分水岭。而API聚合平台的价值,恰恰在于帮开发者以最低成本捕捉这种技术红利。

两项核心升级

  1. 编程与Agent能力全面提升

GLM-5.3被官方称为“编程能力最强的开源模型”。

在智谱内部Z.ai Code Bench真实体感评测中,GLM-5.3较GLM-5.2提升50%

在Terminal-Bench 3.0(模拟真实终端环境)得分从4.6提升至28.3

在Agents' Last Exam(CLI)(评估命令行Agent能力)等公开基准中,达到开源模型SOTA水平

这意味着模型从“能写代码”进化到了“能完成复杂终端任务”——对做自动化运维、复杂脚本开发、AI Agent调度的开发者来说,这是实实在在的能力提升。

  1. 网络安全能力显著涌现

官方用了一个很有意思的词——“涌现”。这不是定向训练的结果,而是在充分的后训练强化学习过程中自然生长出来的能力。

在CyberGym漏洞推理评测中,GLM-5.3得分为84.5%,高于GLM-5.2的77.2%,也超过Mythos 5(83.8%)和GPT-5.6 Sol(83.6%)。

不过需要注意的是,在ExploitBench(将漏洞转化为可利用攻击的能力)上,GLM-5.3得分54.4%(是GLM-5.2的24.4%的两倍多),但仍低于Mythos 5的78.0%。

更具体的数据:智谱联合清华大学、南开大学、绿盟科技、赛博昆仑、DARKNAVY、腾讯玄武等多家安全团队开展红队测试,累计发现2436个漏洞,其中1097个为中高危,涉及系统内核、操作系统、浏览器引擎、开源基础组件等269个项目。

其中最具标志性的发现是:研究人员借助GLM-5.3发现了潜伏40余年的DNS协议级漏洞,攻击者仅需少量特殊请求即可将服务器压力最高放大近8万倍,潜在影响超过1000万处公网DNS服务。

这意味着模型不仅能写代码,还能审查代码里的“陈年旧坑”——从生产力工具进化为代码质量和安全的守护者。

后训练是怎么做到的?

智谱在公告中首次披露了后训练的技术框架:IndexShare、SAO、新一代Slime框架(注意是Slime,不是S1me)。

简单理解,后训练的发展可以分为两个阶段:

第一阶段:单轮Q&A的RL。模型回答一道题,告诉它对还是错,然后更新权重。

第二阶段:放进模拟环境训练。以Coding为例,不再只是给一道编程题,而是给它一个真实的代码库,允许调用Terminal、修改代码、运行测试。模型可能连续几十步甚至几百步,最后根据任务是否完成来获得Reward。

这时候,模型开始学习怎么使用工具,以及在很长的任务里保持目标。

所以Post-training Scaling和Pre-training Scaling的东西不一样:

预训练:Scale参数、数据、算力——读万卷书

后训练:Scale环境的复杂度、任务的长度、经验的丰富度——行万里路

智谱在公告中写道:“可能我们还远未开发出这个基座的智能上界。” 这意味着GLM-5.3还不是终点,同一个基座还能继续往上走。

开发者现在就能用 GLM-5.3已于8月14日13:00正式上线Coding Plan,开放新用户订阅。

即日起上线:智谱官方编程工具ZCode、效率工具AutoClaw

全员额度已重置:可在后台「用量统计」中查看

平台接入:GLM-5.3将接入Trae、WorkBuddy、Qoder、CawPaw和OpenCode等平台

开源时间:发布两周后开放完整模型权重(需完成安全评估与模型加固)

API先行,开源跟进——开发者可以先通过API验证效果,再决定是否投入资源做本地部署,试错成本大幅降低。

对开发者的价值

Token利用率更优

在Z.ai Code Bench评测中,GLM-5.3在High档位下准确率(31.4%)超过Claude Opus 4.8最高档位(29.5%),但每项任务平均输出约5万tokens,而Opus 4.8需要约12万tokens。 对于高频调用API的开发者,这种“Token利用率”的提升直接转化为账单上的成本节省。

版本切换成本几乎为零

GLM-5.3发布后已快速接入多家第三方平台,开发者只需将模型名从glm-5.1改为glm-5.3即可完成升级。

安全能力落地 智谱还计划启动“Open Source Shield”开源护盾计划,对精选开源项目进行安全审计,并为防御性安全工作提供模型访问权限。

结语

GLM-5.3的发布印证了一个趋势:基座决定下限,后训练决定上限。

对开发者而言,这既是机会也是挑战——机会在于能力更强的模型不断涌现,挑战在于选择成本和评估成本同步上升。

API聚合平台的价值,正在于成为开发者与这些前沿模型之间的“高速公路”:你不需要关心接口格式、计费方式、版本更新,只需要专注于用模型解决实际问题。

智谱在公告结尾引了一句话:“单弦不成音,独木不成林。”

这大概有两层意思。一层是国内模型之间你追我赶的状态——DeepSeek、Kimi、Qwen、GLM、豆包,大家的节奏都非常快。这种竞争最后会逼着所有人一起往前走。

另一层是合作和生态。这次GLM-5.3的网络安全能力,背后不是模型团队自己能完成的——整篇公告里提到了清华、南开、绿盟、赛博昆仑、DARKNAVY、腾讯玄武等安全团队。安全需要专门的Know How,更深入的芯片、人才、开源社区,也是一样。

GLM-5.3的API即将上线,开源权重也将于8月底开放。用一个Key,触达这个时代最强的生产力。

以 AI 之力,筑未来之境

现在注册,立即免费获赠 200 次大模型调用权益

免费注册 →