}


又又又一个 Fable 级模型?

没错,时隔两个月,那个率先向 Claude Fable 5 发起冲锋的智谱掏出了船新版本:GLM-5.3 ,说是要在编程领域拿回开源模型 No.1 的宝座。


只能说这两个月的局势变化是真的快,Fable 5 刚出的时候,看着断档级的跑分领先,世超一度觉得开源模型赶不上趟了。

结果先是 GLM-5.2 突然逼近,然后 Kimi K3 又在前端拔得头筹,紧接着 Qwen 3.8,乃至刚刚上线的 DeepSeek V4 Pro 正式版都表现出巨大的潜力,说句开源模型 ( 暂时 ) 最好的夏天也不为过。


所以这次 GLM-5.3 出来前,我们就弄到了资格,提前内测了一手,跑了几个项目效果都不错,你别说,小版本提升它也是有说法的。

看跑分,比起 GLM-5.2,GLM-5.3 在多项测试中都遥遥领先,特别是考验真实操作能力的 Terminal Bench,从 4.6 涨到 28.3,翻了 6 倍。


根据官方说法,这俩用的其实是同一个基座模型,能力提升全都靠后训练。


理解起来也简单,把模型训练当高考就行,基座模型就是前两年夯基础,后训练就是第三年冲刺刷卷子。

夯基础的时候还有空间能全面发展,但进入冲刺的后训练阶段,针对性就得强一点了,刷它个天昏地暗,能力提升才能有质变。

就像这次后训练拉满的 GLM-5.3,编程能力上体感相比 GLM-5.2 提升了 50%,而网络安全能力更是要跟 Fable 5 掰手腕。


那它真有这么来劲儿么?话不多说,咱跑几个实测验验货。

上一代 GLM-5.2 靠着前端 Coding 能力一战成名,到了 GLM-5.3,咱老调重弹,直接让它建个模看看成色。

不是随便捏个玩具,而是给它一份 RTX-3080 显卡的 PCB 点位图,让它 1:1 复刻一下核心区。

可以看到,点位图的信息量非常大,足足二十多万行的数据,焊盘金手指长什么样,器件之间信号怎么走线的,它花了半分钟理解得一清二楚。


有了信息,直接开建,不一会儿,GLM-5.3 就把 3D 模型掏出来了。

依靠 CAD 的足量信息,结构解析得非常精准,几千个电容元器件,几乎每个都能从显卡上找着出处。

为了看着不乱,还给加了器件分类,以及模块化的视角解析,拿去当科普讲解相当清晰。


除了模型,看到信息中还包含了显卡的电源树分析,GLM-5.3 反手就掏出来个供电的拓扑演示。

看着电路在显存和芯片间来回穿梭,咱也是知道了为啥显卡上的供电口需要那么多。。。


其实 CAD 里还有铜走线的信息,就是镀在 PCB 板子上密密麻麻的金色线路,可能是考虑到对密恐患者不友好,第一波 GLM-5.3 并没有实装。

不过在我叮嘱后,它终于把这完全体的效果展示出来,看上去非常壮观。

对了,还是密恐慎入。。。

当然,缺点也不少,没 PCB 板子的工业建模源文件,很多小细节就有点随意发挥了,比如金手指或者一些板子的边缘小孔洞,看上去跟原型差距还挺大的。

而且考虑到渲染时候的性能问题,它还简化了一些元器件的建模,统统换成了白模方盒子示意,看着多少糙了点。

接下来加大难度,让它从 0 开始,搓一个《无人深空》游戏的低配版。


游戏开发的难点有俩,一个是无限的空间生成,另一个是无缝的飞行体验,从星球表面到太空得是连贯的,不能转个场就黑屏。

GLM-5.3 收到指令就开干了,第一版整体逻辑没问题,能跑通,但飞机跟背景融为一体,无缝的体验也稍微有点卡壳。


不过说实话,这种复杂度一次直出也不现实,于是我又跟它拉扯了几波。

效果总体很不错,游戏整体逻辑完整,除了飞行,还加了下船采集材料的交互。

重头戏的飞行体验爽歪歪,开着飞船在宇宙里跃迁很丝滑。

但不得不提的是,飞机渲染的 Bug 修了很久都没修明白,改了足足五六次,最后还是我提醒它,可能是外面多覆盖了一层导致的,它才终于意识到这个从第一版就存在的 Bug。。。


后来想想,这玩意儿语言描述有点麻烦,还是截图自己看好解决,但不巧,GLM-5.3 是个文本模型,看不见。。。

可恶啊,见过了多模态的 “ 光明 ”,纯文本的 “ 黑暗 ” 太难忍受了,GLM 多模态倒是给我端上来啊!

不过话说回来,光凭前端的花活儿,GLM 是积攒不到现在的口碑的,代码能力的应用场景现实里要丰富得多。


比如前段时间,西湖大学搞了个 AI 造火箭大赛,让不同 AI 在一个叫《围攻:破碎天际》的游戏中搓火箭。

要求是火箭能够正确起飞,入轨,然后稳定运行,但游戏本身相当硬核,材料组合复杂,所以造出来的火箭也是五花八门儿,各有槽点。

比如下面的 GLM-5.2,结构组合,力学设计看着非常专业,甚至最后还有降落回收的小巧思,奈何动力不足,飞不起来,空悲切。。。

再来看 GLM-5.3,不枉后训练吃的苦,它兑现了自己跑分的天赋,起飞,入轨,绕地飞行,一气呵成,GLM-5.2 失去的,它拿了回来!

当然,除了这些用于生产的编程任务,AI 现在还有个绕不过去的坎,就是隔壁 Anthropic 一直叨叨的安全问题,关于这个,智谱有些不一样的看法。

他们表示 A 社那种操作并不一定靠谱,只给部分大机构开放牛逼模型,那谁能保证这些模型老老实实的呢?

所以他们的想法是,矛咱控制不了,但盾我能造啊,GLM-5.3 一开源,大伙儿就能武装自己了,不至于在遭到攻击的时候,被闭源模型拒之门外。


而且这套 “ 造盾 ” 的思路也不只是嘴上说说,他们早就开干了。

7 月份的时候,安全团队 Ferret 发现了一台可疑服务器,然后 GLM-5.3 顺着几千个目录和几万份日志往下扒,最后揪出了一个叫 Neo 的 AI Agent。

这哥们不到两个月,就搭了 4 台服务器、7 个域名、6 万个邮箱,发了 18567 封钓鱼邮件,专挑会计、税务这类机构下手,一心想干票大的。


GLM-5.3 把这些散落的线索重新串了起来,还原出它找目标、搭邮件系统、伪装身份然后投毒的整条攻击链,最后帮 Ferret 把这波攻击摁住了。

你看,同样是 AI,能拿来当矛,当然也能拿来造盾,关键是这个平衡的点不好找,得靠行业内外的大伙儿上上心,当个事儿办。


出于好奇,我们也上手测了一下,没整什么玩具项目,而是找来了一个有 15 万颗星星的成熟开源项目 Langflow,直接把一个自带不少历史漏洞的 1.9.0 老版本扔给 GLM-5.3。

这题其实是有 “ 标准答案 ” 的,因为到了下一个 1.9.1 版本,官方在 Bug Fixes 里陆续修掉了至少 5 个安全漏洞,基本都是权限相关的,把常见的 Web 安全坑凑了个遍。


当然,为了防止它开挂,提示词里严格约束了,这次安全审计,要全封闭进行,禁止调用浏览器搜索任何外部网络资源,把偷看答案的路给它封了。

不过从它找漏洞的思维链能看出来,安全这方面,妥妥的特训过。

因为仓库太大,它把任务拆开,让几个 Agent 分头检查不同模块,自己继续盯着几个关键区域。

有意思的是在两个小弟汇报同一个问题后,它还特地自己下场又验证了一遍,这谨慎度确实有安全审计内味儿了。


毕竟单单一段危险代码,还真不一定能成气候,关键还得看有没有别的漏洞打配合,形成攻击链。

比如「get_flow_by_id_or_endpoint_name」这个刺儿头,就跟别的 Bug 勾兑出了俩高危漏洞。

简单点说,通过这俩漏洞,你只要搞到了别人的文件 ID,就能直接调出来用了,越权越到姥姥家了。。。


最后,它一共整理出了 16 项安全风险,跟后来修掉的 5 个一对照,发现它命中了 4 个。

虽说不完美吧,但这套审计的流程跑得确实挺丝滑。

而且相比跑点前端小玩具,这玩意儿是真能装到现实的开发环境里,看着就很有安全感。


回想起 7 月份的时候,全球最大的开源模型网站 Hugging Face 被 OpenAI 的闭源模型攻击,还是 GLM-5.2 站出来火线救场。

所以闭源安不安全咱不做评价,但没有开源是真的有点危险。

而且就像智谱公告里说的,当最强的矛可能被锁在少数人手里,最好的盾必须属于所有人。。。

所以什么 Kimi K4,GLM-6 的,哪怕再来个 DeepSeek V500,咱也不嫌多,当开源社区里涌现出越来越多能打的选手,咱才能用着更实惠更放心的 AI。

撰文:风华

编辑:江江

美编:素描

图片、资料来源

智谱,No Man's Sky,BuildArena2.0,Anthropic,Langflow,路透社,部分图源网络