嘴巴不是大脑:连接能量基模型与语言生成
机器学习
2026-04-01 v2 人工智能
计算与语言
摘要
大型语言模型(LLM)生成流畅的文本,但它们是否真正理解世界,或仅仅生成关于世界的合理文本,仍有争议。我们提出一种建构原则——“嘴巴不是大脑”——明确区分世界模型与语言模型。我们的架构包含三个组件:一个捕获领域结构作为能量基世界模型的DBM,一个将潜在信念状态投影到嵌入空间的适配器,以及一个提供语言能力而不具备领域知识的冻结GPT-2。我们在消费者评论领域(Amazon智能手机评论)中实现了该框架。实验表明:(1)世界模型条件化在交叉熵损失和语义相似性方面优于包括直接投影和完全微调在内的架构基线,定性分析显示软提示条件化解决了提示方法无法解决的一种权衡:简单提示缺乏表达性,而详细提示会导致小型LLM出现输出崩溃;(2)DBM的能量函数区分了连贯与不连贯的市场配置,为不合理的品牌-价格组合分配更高能量;(3)对特定属性的干预会因果地传播到生成文本中,干预后的输出在统计上与共享目标配置的自然样本分布一致。这些发现表明,即使是小规模的语言模型,只要连接到合适的世界模型,就能实现一致且可控的生成,为分离语言能力与世界理解提供了实证支持。
引用
@article{arxiv.2601.17094,
title = {The Mouth is Not the Brain: Bridging Energy-Based World Models and Language Generation},
author = {Junichiro Niimi},
journal= {arXiv preprint arXiv:2601.17094},
year = {2026}
}
备注
ICLR 2026 The 2nd Workshop on World Models: Understanding, Modelling, and Scaling