GLM 5.2 实战翻车实录:理想丰满,现实却狠狠打了脸
事情起源于这个月Workbuddy赠送的积分即将到期,加之我Codex的额度仅剩2%,在等待重置之前实在舍不得再动用充值卡。恰好手头有一个PMBrain的需求需要调整,于是便决定让GLM 5.2来接手这次修改任务,毕竟它一直以来的口碑相当不错。
为了稳妥起见,先通过ask模式进行了两三轮的方案讨论,梳理出明确的执行思路后才正式开始动手。

光是执行这个小改动的积分消耗,加上此前几轮的交互,基本上把我这段时间攒下来的积分全部清空了。本以为一切顺利,结果出来的效果却让我大吃一惊——这个bug离谱到甚至让我进入应用后不得不重新去配置数据库。我赶紧追问GLM到底是怎么回事,它倒也不推诿,干脆地承认是自己的操作出了错。

事已至此,只能硬着头皮让它继续修复。看它语气比我还要着急,紧接着一通操作,甚至之前我特意定义的一些约束条件也似乎被抛到脑后,直接给我打了一个全新的包,催促我赶紧测试。
这次虽然不再有阻塞性的bug,但更严重的问题随之而来:我压根没看到自己想要实现的功能。一开始我还以为是自己没找对地方,于是客气地再问它。

它的回应却让我彻底失望,不仅完全没有理解我的意图,反而把我原本能正常使用的功能给改坏了。那一瞬间,我对GLM 5.2的所有滤镜碎了一地。曾经一直拿它当“国内名校”顶尖高材生来看待,没想到实际水平也就堪堪和Deepseek打个平手,而消耗的“薪资”却高得离谱,这实在让人难以接受。
这次真的把我惹毛了,忍不住劈头盖脸一段输出,差一点就要飙脏话了。跟Deepseek打交道多年让我明白,愤怒没有任何用处,只能保持理智而又激烈地把需求重新说清楚。要是对面是个人,大概已经吵起来了。

结果又一次出来了,依旧是自行打包,没有完全遵守我的约束。我也不再计较细枝末节,先打开看看到底改没改好。万幸这次总算呈现出了我想要的内容,于是立刻开始测试,甚至还连上另一台电脑进行验证。然而,麻烦又来了。
它修改的OAuth客户端根本不支持连接到MCP上,意味着之前所有的折腾几乎全是无用功!这次错误直接暴露了从讨论阶段它就已经把我带进了沟里。反思之下,确实怪我太相信它的实力,没能及早对方案提出质疑,也怪我一开始就没有分清API key接入和OAuth客户端接入的差异,导致方向错误。但话说回来,又有谁能对一整个项目了如指掌呢?连这点分析都做不明白,以后我又怎么敢再托付信任?
于是,我用仅剩2%额度的Codex,去review GLM 5.2所写的代码,并且让它把API key支持共享模型的需求一并加进去。Codex果然不负所托,在额度几乎见底的情况下完美实现了我的需求。

GLM 5.2输出的代码也确实被查出了问题,上图里提到的那些细节我未必全懂,但有一条让我印象极其深刻——它根本就没有根据这次需求去修改测试脚本。不修改倒罢了,关键它连测试都没有执行,这一点真的,让人无话可说……
我的思考
这次经历对我的“打击”着实不小。一直以来我都是国货的坚定支持者,论坛上但凡有人夸国产模型的好,我都会去“帮帮场子”。可亲身经历下来,GLM 5.2真的达到了能与ChatGPT 5.5或者opus 4.6同台竞技的程度吗?我深表怀疑。
我也忍不住怀疑是否“马具”的问题,毕竟Codebuddy和Workbuddy这两位坑我也不止一次两次了,但腾讯豪爽大方,积分送个不停,我也只好“当没发生过”继续用下去。也许确实是误判,也许我压根没体验过正宗版的GLM 5.2,Workbuddy上的GLM很可能是腾讯拿开源自己部署的,未必随着智谱持续更新升级,降智的情况恐怕在所难免。
我真心希望国产模型能越来越好,盼望着有朝一日,那些用惯了ChatGPT和Claude的用户全都回流。也诚心希望腾讯打造的Workbuddy能够击败Codex,让每个人都用得舒服自在,对每一个功能和细节都发出由衷的赞叹。
只是,不要让我们等太久哦!