GLM-5.2开源了 MIT协议免费商用 开源模型第一次追上ChatGPT
最近两天刷 Hacker News,两条帖子直接给我整不会了。
一条900多分,Z.ai 发布了 GLM-5.2,MIT 协议开源,智力指数拿到 51 分,距离 GPT-5.5 只差 4 分。另一条 1300 多分,标题直接问「有没有人已经用本地模型替代 Claude 和 GPT 写代码了」,底下 500 多条评论炸开了锅。
我自己的感受是,这尼玛就是,等了很久的那个信号。
说真的,过去一年我一直在观察开源模型的追赶速度。从 DeepSeek V3 到 Qwen 3.6 到 MiniMax M3,每次都是「快了快了」,但跟 Claude 和 GPT 的差距始终像隔着一条河,看得见岸但过不去。
GLM-5.2 可能是第一个让我觉得,真的有可能趟过去的一个。
先说说 GLM-5.2 到底强在哪
Artificial Analysis 智力指数,目前公认最靠谱的模型评测榜单之一。GLM-5.2 拿到了 51 分,排在所有开源模型的第一名。GPT-5.5 是 55 分,Opus 4.8 也差不多在这个区间。也就是说,这个开源模型跟地球上最强的闭源模型,只差 4 分。
4 分是什么概念?同一梯队内,不同推理强度设置都能差出 4 分来。
更离谱的是幻觉率。DeepSeek V4 Pro 的幻觉率高达 94%,遇到不会的问题几乎全在编。GPT-5.5 好一点但也到了 86%。GLM-5.2 只有 28%,不到 GPT-5.5 的三分之一。有人拿同一个复杂的 Python 问题分别测试了 DeepSeek V4 Pro 和 GLM-5.2,DeepSeek 用了将近 4 分钟思考,输出了 7700 个 token,答案全是错的。GLM-5.2 只用了 12 秒,800 个 token,直接告诉你这个需求有技术上的不可能性,并解释了为什么。
12 秒 vs 4 分钟,800 token vs 7700 token,正确 vs 胡编。
这个差距太扎心了。
然后说协议。MIT 开源,免费商用。这意味着你可以把 GLM-5.2 接进你的产品里卖钱,不需要给 Z.ai 交一分钱,也不需要公开你自己的代码。在开源大模型圈子里,MIT 协议算是最大方的了,DeepSeek 用的是自家的协议,Qwen 也有各种限制。
定价方面,Z.ai 官方 API 是每百万 token 输入 1.4 美元、缓存命中 0.26 美元、输出 4.4 美元。横向对比一下,GPT-5.5 的价格大概是这个的 5 到 10 倍。而且 GLM-5.2 的 KV 缓存命中率据说超过 95%,实际使用成本还会更低。
上下文窗口也从 GLM-5.1 的 20 万 token 扩展到了 100 万 token。
1300 分的讨论帖里,开发者们怎么说
那条「有没有人已经用本地模型替代 Claude/GPT」的帖子,是我今年在 HN 上看到的编程类话题中讨论最热烈的一个。1306 分,560 多条评论,每一个认真写代码的人都在聊自己的实际体验。
评论区的情况大概分成了两派。
一派是「够了,日常完全够用」。有个开发者说他用 RTX 5090 跑 Qwen 3.6 27B,搭配 llama-server,日常的脚本、数据处理、小型项目开发已经完全不用开 Claude 了。还有人用 M4 MacBook Pro 36GB 跑 Qwen 3.6 35B,80 token/秒,也是日常任务不用云端。
一个 24 人的公司买了两台 DGX Spark,全部自给自足,不管外面 AI 怎么涨价怎么出事,他们自己的 AI 基础设施完全不受影响。
另一派是「还差得远」。做 DevOps 的、写基础设施代码的,普遍觉得 Claude 的能力目前没什么能替代。有个哥们说得很直接,「我试了所有开源模型包括最大的 Qwen 480B 和 Kimi,没有哪怕一个能接近 Claude,我宁愿用 Sonnet 也不碰 Qwen」。
我觉得两边说得都对。取决于你做什么样的工作。
如果你是写业务逻辑的,CRUD 多、重复性高、需求明确,开源模型确实已经够了。但如果你做的是需要深度推理的事情,比如设计一个复杂的系统架构、调试一个嵌套了三层的并发 bug,Claude 和 GPT 的差距还是很明显的。
不过话说回来,Claude 的优势在缩小这件事本身,才是最重要的信号。
对想靠 AI 赚钱的人意味着什么
我觉得这事对普通人的影响,可能比大家想象的大。
你想想看,以前想做一个 AI 相关的产品或服务,你只有两条路,要么接 OpenAI 的 API,要么接 Anthropic 的 API。定价权完全在别人手里,他们一涨价你就得跟着掏,他们一出新模型你的成本模型就得重算。
现在多了第三个选择,而且这个选择是免费的、开源的、能力已经足够接近的。
具体来说,有几个方向我觉得值得关注。
第一个,AI 编程辅助工具。如果你是做开发者工具的,GLM-5.2 的 MIT 协议意味着你可以把它直接嵌入你的产品里,不需要担心授权问题。做个代码补全插件、做个代码审查工具、做个自动生成测试用例的服务,成本结构会完全不一样。
第二个,本地部署咨询服务。评论区里很多人想用本地模型但不会配,什么量化方式、KV 缓存设置、推理引擎选型,这些对普通开发者来说门槛不低。有些人已经在做这件事了,帮企业搭建本地 AI 基础设施,按项目收费。
第三个,多模型路由。很多开发者的实际做法不是二选一,而是简单任务用开源模型省成本,复杂任务切回 Claude。如果你能做一个智能路由工具,根据任务复杂度自动选择最合适的模型,这玩意儿是有市场的。
第四个方向比较骚,是 模型微调服务。GLM-5.2 开源意味着你可以拿它做基础模型,针对特定行业做微调。法律、医疗、金融,每个领域都需要自己的专业模型,但不是每个公司都有能力从头训一个。你帮他们微调,收服务费。
一些踩坑经验
如果你打算试一下 GLM-5.2 或者其他开源模型,有几个坑我想提前帮你踩一遍。
量化方式影响巨大,这一点怎么强调都不够。有人用 IQ4_XS 量化跑 Step 3.7,效果好得出乎意料。但换成另一个量化级别,同一个模型可能就疯狂循环思考、烧掉大量时间还给出错误答案。建议你用你自己的实际任务做评测,不要只看跑分。
推理引擎的选择也很重要。llama.cpp 和 Ollama 是最流行的,但很多人发现切到 llama.cpp 之后性能提升明显,特别是在 M 系列 Mac 上。也有人在用 Opencode、Pi 这些专为编程场景优化的 agent 框架,配合本地模型使用。
还有一点,不要只跑一个模型。评论区里有个老哥的方案很有意思,他同时跑 20 多个自烘焙的模型,用不同的 harness 配合不同的任务。他说 harness 跟模型一样重要,同一个模型换一个 harness 可能效果天差地别。
说实话我自己也还在摸索这一块,不敢说有完整的经验。但有一点我很确定,如果你想认真玩本地 AI,不要一上来就追求最大最强的模型,先从一个 7B 或 9B 的小模型开始,把整个工作流跑通,然后再往大模型升级。
回到更大的视角
我越想越觉得,GLM-5.2 的意义不在于它是不是真的比 GPT-5.5 强。这个不重要。
重要的是,一个 744B 参数的开源模型,MIT 协议,免费,智力指数 51 分,幻觉率 28%。
这个东西一年前不存在。
两年前连 DeepSeek V2 都还没出来。三年前 GPT-4 刚发布的时候,开源模型跟闭源的差距是跨物种级别的。
现在这个差距是 4 分。
我不知道 GLM-5.2 之后下一个模型会不会直接追平。但我知道一件事,速度没有放缓反而是在加速。MiniMax M3 是 44 分,三个月前发布的。GLM-5.2 是 51 分,刚发布的。中国团队的开源模型迭代速度,已经快到让人有点麻木了。
磨平一些信息差。
想了解更多 AI 副业方向和工具使用技巧?
免费领取 AI 副业提示词全家桶 →