近几年来,人工智能领域最为耀眼的成就莫过于大型语言模型(LLM)的快速崛起与广泛应用。自GPT系列模型、Claude、Gemini、Mistral等模型相继问世以来,越来越多的场景中,AI不再是冷冰冰的逻辑模块,而是可以对话、写作、编程、推理的智能体。许多人开始憧憬:既然AI已能生成优美文字、解答复杂问题、通过律师与医师考试,AI 和人类的交互越来越有“人性”,那通用人工智能(AGI)是否已经不再遥远?
然而,随着人们对LLM能力的进一步观察与深入使用,越来越多的迹象表明,目前的大语言模型虽然显示出前所未有的强大,却还远远不到AGI的临界点。LLM是“智能模拟”的一个高峰,却并未穿透智能本身的边界。从预测语言到理解世界,从生成文本到做出行动决策,大家越来越清楚地看到,这条路远比人们最初想象的要曲折而复杂得多。
当前的LLM触及发展瓶颈的时候,我们不得不再次正视LLM与人类智能之间的本质差异,更谨慎地分析实现AGI还需要的模型与算法,重新理解“智能”的构成,并在未来的架构中超越单纯的语言模型。
语言模型的辉煌与极限
大语言模型的成就毋庸置疑。通过大规模文本语料和深层神经网络的训练,它们在自然语言处理领域表现出了超出预期的能力:生成流畅、语义连贯的文本,能够进行基础推理,甚至可用于编程、翻译、写作与教学等多种任务。
但正如人们在使用过程中所发现的那样,LLM虽然擅长模拟人类语言,但并不真正理解语言所指代的世界。在具体表现上,它们仍存在以下问题:幻觉(hallucination)频发,即生成不真实或无依据的信息;逻辑推理能力薄弱,难以处理复杂的多步骤逻辑或数学问题;记忆能力有限,无法跨文档、跨时间整合信息;没有上下文感知能力,无法真正“理解”场景或情境中的变化。
更关键的是,大语言模型缺乏世界交互能力。它们的知识来源于训练数据——大量的网页、书籍、代码与论坛帖子,而非通过亲身感知、实践或社会互动获得。这意味着它们缺乏所谓的“感知—行动—反馈”的基本智能环路。它们可以“说”,但不能“做”;可以“编造”,却不能“验证”;可以“预测”,却不懂“因果”。
人类智能并不只是语言
如果说LLM模拟的是“语言的外壳”,那么人类智能则是一整套深度整合的系统。这种系统不仅包括语言处理,还包括感知、记忆、动机、情绪、注意力、行动能力与元认知能力等。
人类从一出生就生活在一个动态变化的世界中,通过视觉、听觉、触觉、本体感受、嗅觉等多模态输入建立起对世界的模型。这种模型不是靠静态文字,而是通过经验、互动、游戏、实验和反馈不断强化的。而LLM则没有身体,也没有感知,所拥有的只是文字的相关性统计。这就造成了一个根本性的差异:人类知道“杯子能装水”不仅是因为语言说了这件事,而是因为我们看过、摸过、用过杯子。而LLM“知道”这件事,是因为成千上万个句子都在说“杯子装水”。
更进一步,人类智能有目标、有动机、有情绪、有欲望。我们做决策时会考虑代价、风险、奖励与情境;我们能从失败中学习,从经验中反思,从他人那里汲取教训;我们拥有短期与长期的记忆,能在数秒内记住对话,也能在多年后想起童年的某个片段。当前的LLM,即使具备越来越大的上下文窗口,也无法在这种多层级、多尺度、多时间维度的记忆系统中自如穿梭。
最后,人类具备自我模型。我们可以思考自己在思考什么,预测别人会怎么想我们。也就是说,我们不仅有智能,还有“自我意识”的雏形。而LLM仍是一个外部操控的黑箱,其“行为”完全依赖于输入的提示词(prompt),不具备内生的自我驱动。
瓶颈的浮现与行业的转向
2023至2025年间,AI社区已经从最初的狂热转向了冷静分析。越来越多的研究者开始指出,仅靠继续放大LLM的参数规模和训练数据,并不能持续带来智能能力的跃升。实际上,从GPT-3到GPT-4再到GPT-4o,其语言生成质量提升幅度逐渐减缓,而计算成本则指数级增长。
OpenAI在其最新的技术报告中也承认,未来的突破可能不再只是“更大模型”,而是“更好的系统”。图灵奖获得者、Meta的Yann LeCun甚至直言:“LLM训练的是文本的模仿,而不是对世界的理解。” 他提出了一种多模块系统蓝图,包括感知模块、世界模型、短期记忆、规划器与行动器等。这些构成了一个“可以感知、记忆、计划并行动的系统”,而不仅仅是一个聊天机器人。
DeepMind方面,也正在从“预测式模型”转向“世界模型”(world models)方向。其Gato模型尝试用同一个架构处理多种模态任务,从游戏控制到对话生成,从图像识别到物理交互。MuZero则进一步探索“无需明确规则即可通过经验进行学习”的新方向。这些研究,都表明了一个共同的趋势:语言预测不等于理解,模仿人类语言不等于模拟人类智能。
更具代表性的还有最近被称为“神经符号AI”(neuro-symbolic AI)的研究路径,旨在融合神经网络的表示能力与符号逻辑的推理能力。通过将LLM与知识图谱、逻辑引擎、约束系统等结合,可以弥补LLM在因果推理与物理常识上的缺陷。
(未完待续)
其它作品
去班夫路上的几座山
洛基山迎面而来
卡尔加里,加拿大的石油之都
卡尔加里的中国城
丹佛机场的那片”雪山”
班夫镇大街上
始于收笔 — 读辜学耕《墨玉兰》系列
祝美国立国250周年
云水写生:甘孜协庆寺(一)
疫情和暑假之前
推理是什么?从人脑到人工智能的逻辑机器
廖新松采风作品
在人物消失之后 — 廖新松近作中的存在与绘画
艺术不会因为AI消失
美:意识与世界之间的和谐
艺术的意义是否超越模式识别?
- 去班夫路上的几座山 - 08/16/26
- 洛基山迎面而来 - 08/15/26
- 卡尔加里,加拿大的石油之都 - 08/10/26
