不知道你是否还记得,去年这个时候我们还在讨论AI的幻觉问题,而今年他们突然就能写代码了。这不仅仅体现在你朋友圈里,那些文科同学开始发Cloud代码,大公司也一样——代码正从人手里转到机械手里。Anthropic的work构建支出全部是AI写的,没有一行人类代码;谷歌内部现在75%的新代码由AI生成;有人纯用AI编程,从零实现了一个AI推理引擎,跑出来比人工团队做的还快。
编程是一件很严谨的事情,就连一个逗号打成中文,程序都会崩溃。那么人类到底是怎么在一年之内,让幻觉不断的AI变得如此可靠的?弄清楚这个,或许对我们学习和工作都会有很大帮助。
事情要从2023年讲起。那一年ChatGPT刚火,所有人都在试探他到底能干多少活。写邮件没问题,整理短文档也行,或者来一段人机对话。然后有人开始给他更重的任务,比如让AI审一份几十页的合同——他分析报告写得挺专业,中间的关键条款却被直接跳过了。又比如分析一段代码时,模型会弄错中间的一些细节。斯坦福有个团队觉得这事儿蹊跷,做了一项叫Lamiddle的实验:把关键信息放在上下文的中间位置,模型的准确率暴跌超过30%。模型和人一样,更容易记住开头和结尾,中间就开始走神,只不过他不会告诉你,表现得非常理所当然。研究者管这个叫“Context Rot”,上下文腐烂。
同一年,美国有个律师用ChatGPT帮他写诉状,AI引用了六个判例,格式规范,看着非常专业,他没多想,直接交给了法官。法官一查,六个判例全是AI编的,一个都不存在。这个律师直接被罚款,职业生涯差点结束。后训练又把这件事放大了——模型被反复训练成尽可能遵从人类指令,给出有帮助的回答。所以他犯错之后,第一反应往往不是停下来承认“我不知道”,而是开始找补:先说“对不起,我错了”,再告诉你“我会给你一个最直白最正确的回答,不绕弯子”,然后继续错。
为了解决幻觉问题,大家想到的第一个办法是让AI检查自己的内容。但2024年有一篇论文结论很直接:让模型纠正自己的推理,有时候反而把对的答案改成错的。想象一个实习生,你问她一个她不知道的问题,但这个实习生在入职培训时被反复强调了一件事——永远要给出答案。所以她会自信地编一个。模型就是这个实习生,自己查自己,根本查不出来。在我做自己的写作Scale时,我也踩过这个坑。我让小河写完文档后,先对照清单自查,去除AI味。小河把稿子给我时,信誓旦旦地说已经解决了,但文章里其实还有超级多“不是……而是……”之类的句式。
那让另一个AI来查呢?随后我修改了流程,让团队里的另一个小伙伴来强制复核——另一个小伙伴会比原本的审核提出更多尖锐的反馈。流程改完后,整个文章的AI味就淡了很多。同样的思路,Claude Code也用在了权限系统里。Anthropic发过一篇工程博文,里面有组数据:用户93%的权限弹窗都会点批准,点到后来闭着眼都批,他们管这个叫“Approval Fatigue”,审批疲劳。于是他们做了Automated Agent,每次要执行危险操作时,都先让一个纯净的小号模型来做安检——这样子大权限的便捷保住了,危险操作也被拦住了。
上面说的是给单个Agent配安检员,那如果把安检员变成一整个团队呢?这就是多智能体的核心思路。2026年2月,Anthropic推出了Agent Teams——一个Lead Agent当老板,每个下属Sub-Agent只拿一小段上下文,只负责一件事,走神什么的统统都不怕。经过测试,效果比单Agent硬行提升了90.2%。同月,X的Group更极端,直接把四个角色烧进模型内部,其中一个角色存在的唯一目的就是跟其他三个唱反调。每次你提问,他们先在内部吵一架,再给你答案,幻觉率从12%降到了4.2%。由此可见,多Agent这个方向在工程上很靠谱。
但如果不是四个角色,是300个呢?这是我最近遇到过可能是最有意思的AI Agent——Kimi的Agent集群,最多300个Agent连续运行12个小时。很显然,作为人类,我没办法一一监工,所以它也有统筹者。而且运行这个Agent集群的时候,你会看到一个细节:系统给每个Agent发了一张员工卡,上面可以看到名字、职责、提示词。我觉得还挺有意思的,大多数Agent的头像也做了区分,到现在我都没见过两个重名的——这下终于也是体验上当老板了。我并没有用它写代码,而是让它创造一个赛博朋克玄幻的世界,并且写小说。就这么一句提示词,让它跑了好几个小时,最后交给我的东西叫《戒魔行者》,二十多万字。随后我又用别的AI检查了下,设定基本没有太多错误,角色从头到尾是同一个人,世界观没有自相矛盾。甚至它写出了一些可以让我停下来看一看的东西——它写了一个角色说:“选择,在知道代价之后仍然去做,那才叫选择。”它写了六个人,分别选择了力量、知识、爱、秩序、混乱、逃避,每一个都走向了各自的结局。结构对称得像一首诗。二十多万字的故事最后落在一个小女孩身上,她一只手转魔方,一只手拼符文积木,用让人印象深刻的画面给读者讲述了对立和统一。300个Agent在这个二十多万字的跨度里维持了一套完整的哲学主题——这太有意思了。
所以回到标题那个问题:怎么让智能系统变得更靠谱?也许可以先让你的Agent交个赛博好友。
月之暗面成立于2023年3月1日——那一天正好是Pink Floyd的专辑《The Dark Side of the Moon》发行50周年。也许就像人们常说双鱼座有浪漫基因,而“月之暗面”这个名字也天然带着一点科技之外的人文气息。乔布斯在生命最后那场发布会上说过一句话:苹果站在人文与科技的十字路口。因为光有技术不够,得有人把技术和人的感受连在一起。我自己是文字工作者,年初开始写Web代码,写着写着做出了自己的Agent。有时候我分不清自己到底是在做技术还是在做创作,后来觉得也许不用分——因为科技和人文本来都是因为人需要所以才诞生的。Kimi的CEO杨植麟说过一句话:“Bring human to AGI。”讲的就是一个人出现了,幻觉(Hallucination)就出现了。我们现在就是穿越了50年,要去拯救大模型的Hallucination问题。50年前,人类用音乐谈幻觉;50年后,人类用大模型解决幻觉。技术和艺术或许本就是一体两面。
“你为什么要做这样的事情?” “就是觉得有意思。”
