群山与星空前的一个人影
图片来源:@0x_vertigo

有几位朋友请我解释“狭义 AI”到底是什么意思,所以我们从这里开始。

狭义 AI 指的是在特定任务上能力极强,却不具备通用智能或更广泛意识的系统。它们不会像人一样“思考”,不能反思、感受,也无法从亲身经历中获得意义——至少目前还不能。但在语音转写、撰写摘要或回答问题等边界清晰的领域,它们可以超过人类。

而且在过去几年里,它们极快地变得非常擅长这些任务。

下图基于 TrackingAI.org 的门萨风格测验数据,展示了这种变化的速度。历史快照显示,2022 年的语言模型在这些测试上的 IQ 等效分数约为 40;到 2023 年,已经达到人类平均水平的 100 左右。到了 2024—2025 年,Claude 3 Opus 和 Gemini 2.5 Pro 等模型在特定基准上的等效分数达到 120—150 以上,进入人类测试表现的前几个百分点。

TrackingAI 对语言与视觉模型的 IQ 测试结果
TrackingAI.org 的 IQ 测试结果,截取于 2025 年 4 月 14 日。这些特定基准分数并不衡量通用智能,结果也会随测试方法而变化。

我们怎么会进步得这么快?

2022 年,GPT-3 等模型已经能生成流畅的文字,却不擅长推理。它们会做错逻辑题、误解微妙的指令,也会犯一些基本错误。在 IQ 测试上的等效分数约为 40—70,远低于人类平均水平。它们在某种意义上令人印象深刻,却无法可靠工作。我有幸参与合著了一篇获得 ACL 奖项的论文,证明 GPT-3 并不总能按照预期工作。

2023 年,情况发生了巨大变化。GPT-4 和其他新模型在 SAT、GRE、LSAT 等考试中进入高分区间。语言模型第一次能够通过专业资格考试,稳定地总结复杂法律文本并辅导学生。

随后是 2024—2025 年,以及 Claude 3 Opus、Gemini 1.5 和 2.5 Pro,还有具备视觉能力的 GPT-4o。这些模型不只是达到普通人的水平。在涉及语言推理、模式识别和某些结构化逻辑的任务上,它们开始超过几乎所有人,尤其是把速度也计算在内时。

但 IQ 不等于智能

这些“IQ 分数”是有用的基准,却不意味着机器一定比我们更聪明。它们衡量的是狭窄、以测试为基础的推理形式,而不是人类思维的完整范围。我确实认为这些模型编码了某种“世界模型”,但这个模型极其贫乏。它们是否理解世界、又是在什么意义上理解,仍是一个开放的科学问题。

这正是“狭义 AI”一词最重要的地方。这些模型对世界的理解有限,但它们凭借这套狭窄能力可以完成的事情,依然令人惊讶。

那么,图灵测试呢?

2025 年 3 月,研究人员进行了一项现代版图灵测试。按照 Alan Turing 提出的标准,机器要尝试让人类裁判相信自己是一个真人。

在该研究的实验条件下,一个基于 GPT-4.5 的系统在 73% 的对话中被判断为真人参与者。

我们正在进入一个时代:在许多场景中,机器的语言流畅度已经可以与人类难以区分。这将切实影响信任、信息、教育和工作的未来。

那么,我们现在身处何处?

有几件事已经很清楚:

  • 狭义 AI 在特定语言任务上的表现已经超过大多数人。
  • 相当于 IQ 的基准表现,在几年内从大约 40 上升到了 150。
  • 我们正在进入一个“通过测试”不再是上限、而只是起点的时代。

问题不再是 AI 能否在特定任务上击败我们。它能,而且已经做到了。真正的挑战,是我们如何使用这种能力,以及如何围绕它重新设计自身的责任。

这并不是人类智能的退却,而是在一个不再只有人类能够运用智能的世界里,重新思考智能。

当我们在短短几年间跨过 40、100,再到 150 以上时,值得记住的是:模型正在上升——真正的问题是我们如何与它们一同上升

参考文献