威尔·道格拉斯·海文《麻省理工技术评论》2024-07
图灵测试并不是一个实用的指标,但它的含义深深植根于我们今天对人工智能的看法中。这一点变得尤为重要,因为过去几年法学硕士课程的激增。这些模型根据其外在行为进行排名,特别是它们在一系列测试中的表现。当 OpenAI 宣布 GPT-4 时,它发布了一份令人印象深刻的记分卡,详细列出了该模型在多项高中和专业考试中的表现。几乎没有人谈论这些模型是如何得到这些结果的。
那是因为我们不知道。如今的大型语言模型过于复杂,以至于任何人都无法确切地说出它们的行为是如何产生的。除了少数几家制作这些模型的公司之外,研究人员也不知道他们的训练数据中有什么;没有一个模型制作者分享过细节。这使得很难说什么是一种记忆,什么不是一种记忆——一种随机的鹦鹉学舌。但即使是像 Olah 这样的内部研究人员,也不知道面对一个痴迷于桥牌的机器人时到底发生了什么。
这让问题变得悬而未决:是的,大型语言模型是建立在数学基础上的——但他们是否在用数学做一些聪明的事情?争论又开始了。
“大多数人都试图用空谈来解释它,”布朗大学的 Pavlick 说,这意味着他们在争论理论,而不看真正发生的事情。“有些人会说,‘我认为是这样’,而有些人会说,‘嗯,我不这么认为。’”我们有点陷入了困境,每个人都不满意。”
Bender 认为这种神秘感在神话的创造中发挥了作用。(“魔术师不会解释他们的魔术,”她说。)如果没有正确理解 LLM 单词的来源,我们就会依赖对人类的熟悉假设,因为那是我们唯一真正的参考点。当我们与另一个人交谈时,我们会试图理解那个人想要告诉我们什么。“这个过程必然需要想象单词背后的生活,”Bender 说。这就是语言的运作方式。
“ChatGPT 的客厅魔术如此令人印象深刻,以至于当我们看到这些单词从它里面出来时,我们会本能地做同样的事情,”她说。“它非常擅长模仿语言的形式。问题是我们根本不擅长遇到语言的形式,而不是想象其余的部分。”
对于一些研究人员来说,如果我们不能理解它是如何工作的,那真的不要紧。布贝克曾经研究过大型语言模型,试图弄清楚它们是如何工作的,但 GPT-4 改变了他对它们的看法。“这些问题似乎不再那么重要了,”他说。“这个模型太大了,太复杂了,我们不可能指望打开它,了解到底发生了什么。”
但帕夫利克和奥拉一样,也在试图做到这一点。她的团队发现,模型似乎对对象之间的抽象关系进行了编码,比如一个国家和它的首都之间的关系。在研究一个大型语言模型时,帕夫利克和她的同事发现,它使用相同的编码将法国映射到巴黎,将波兰映射到华沙。我告诉她,这听起来很聪明。“不,它实际上是一个查找表,”她说。
但让帕夫利克感到震惊的是,与傻瓜不同,该模型自己学会了这个查找表。换句话说,法学硕士自己弄清楚了巴黎之于法国就像华沙之于波兰。但这说明了什么?自己编码查找表而不是使用硬编码的查找表是智能的标志吗?你在哪里划清界限?
“基本上,问题在于行为是我们唯一知道如何可靠衡量的东西,”帕夫利克说。“其他任何事情都需要理论上的承诺,而人们不喜欢做出理论承诺,因为它太沉重了。”
(未完待续)
No post found!
- 《纽约客》丨纪念9·11二十五周年 - 09/12/26
- 数学500年:新的黄金时代?(1) - 06/05/26
- 没有美洲,我们吃啥? - 05/17/26
