图片: TheDigitalArtist / Pixabay
中文
在聊天窗口之下,模型本身什么也不会去查,也不知道任何事实。它玩的是世界上最精密的自动补全游戏,理解这一点几乎就能解释这些系统为什么能出色到令人惊叹,又能错得让人尴尬。
让一个现代聊天机器人解释量子力学,它会照做。问它单词”strawberry”里字母”r”出现了几次,它可能会自信满满地告诉你是两次。
这种落差(同一口气里既有天才表现又有低级失误)不是一个能修补的小毛病。它直接来自这些系统的实际运作方式,而这个秘密简单到几乎让人觉得有点难堪。
这就是自动补全,只不过极其出色的自动补全
一个大语言模型只做一件事:给定一段文字,预测接下来最可能出现的一小段文字。然后把这段文字加进去,看着新的整体,再预测下一段。如此反复,重复几百次,直到它为你写出一整篇文章。
仅此而已。这就是全部的把戏。你手机键盘在建议下一个词时,做的就是一个笨拙版本的同类操作。ChatGPT只是把同样的想法放大到了几乎难以想象的规模,用互联网上庞大的一部分文字、书籍和代码训练出来,直到它的猜测变得诡异地精准。
模型本身并没有在查阅什么事实数据库。它是在反复运行数十亿次计算,来回答同一个问题:根据到目前为止的一切,接下来最可能出现的词是什么?
有一个重要的前提需要说明,因为它会改变你应该抱有的期待。模型是引擎,不是整辆车。围绕这些模型搭建出来的产品,现在确实会去查资料:向ChatGPT或Claude问一个时效性问题,它往往会搜索网络并给你附上来源。这种检索能力是外加在猜测引擎周围的,而不是取代了它,这也是现代助手比过去更常把事实说对的最大原因。但在底层,这台引擎依然在猜测。
为什么猜词能产生看似天才的表现
让这一切奏效的关键在于:要在人类写作的全部范围内真正猜准下一个词,一个系统就不得不吸收这些文字背后的种种规律。这包括语法、哪些事实倾向于一起出现、一个论证的结构,还有一个笑话的节奏。
促成这一切的突破是2017年提出的一种设计,叫做Transformer,它让模型能够衡量一段文字中每个词与其他每个词之间的关系,不再严格地从左到右阅读,而是把”注意力”放到相关的上下文上。把这种架构配上足够的数据和算力放大,下一个词的预测就不再像自动补全,而开始显得像是知识了。
但这并不是知识。它是一幅极其详尽的统计地图,描绘的是人类如何使用语言。这也是为什么它能为你写出一首十四行诗,却仍会在一个孩子提出的拼写问题上栽跟头。
为什么它会产生幻觉,而且永远会有一点
当一个聊天机器人编造出一桩不存在的法庭案件,或一本根本不存在的书时,我们称之为”幻觉”。这个词其实有些误导。模型并没有出故障。它正精确地做着自己一贯做的事,生成听起来最合理的续写,只不过在这种情况下,听起来合理的答案和真实的答案恰好不是同一回事。
模型没有单独一套关于”真实”的判断标准。它有的是”可能性”。大多数时候两者是重合的,这也是它有用的原因。但当两者出现分歧时,它会给你一个自信、流畅、彻头彻尾编造出来的答案,内部不会响起任何警报,因为根本就没有警报可响。
那个”strawberry”的问题呢?它看待文字的方式不是一个个字母,而是叫做词元的一块块单位,所以数清单个字母对它来说很别扭。它并不笨,只是它被造出来是为了完成另一种任务,而不是你交给它的这个任务。
这对实际使用它意味着什么
一旦你把”它在预测听起来合理的文字,而不是在检索事实”这句话真正记在心里,整个工具就一下子清晰了:
- 在流畅本身就是目标的场合,它表现得极其出色:起草、改写、头脑风暴、翻译、摘要。
- 在一个自信却错误的答案会让你付出代价的地方,它就很危险:具体的事实、数字、引用、法律或医学细节。这些一定要核实。永远都要。
它并不”知道”自己不知道什么,所以它也无法在自己只是在猜测的时候,可靠地提醒你。
这些机器令人惊叹。但你能对它做的最明智的事情,就是记住它在底层实际做的是什么。它不是在思考,也不是在知晓,它是在预测。一旦你记住这一点,它就不再是魔法,而变成了它本来的样子,而这或许更加令人印象深刻:一面映照出人类写下的一切的镜子,一个词一个词地猜下去,最终猜出了某种看起来很像理解的东西。
资料来源与延伸阅读
本文在 AI 工具协助下研究与撰写,并经编辑核实。仅供一般参考与讨论,不构成专业建议。请参阅我们的编辑准则与免责声明。发现错误?告诉我们。
喜欢这篇吗?下一篇也别错过。
每次一篇好文章,直接送到你的邮箱。绝无垃圾邮件,随时可退订。