中文

小规模 LLM 通过强化学习无法获得可泛化的心理理论

机器学习 2025-07-22 v1 人工智能 计算与语言

摘要

最近的大型语言模型 (LLM) 通过应用规则化强化学习 (RL) 进行后训练,展现出在复杂推理中的涌现能力,这引发了是否可以通过类似方法在 LLM 中植入更细腻、类似人类的社交智能(如心理理论,ToM)的疑问。本文调查小规模 LLM 是否能够通过带可验证奖励的强化学习 (RLVR) 获取鲁棒且可泛化的 ToM 能力。我们通过在各种组合的 prominent ToM 数据集(HiToM、ExploreToM、FANToM)上训练模型,并在保留的 held-out 数据集(例如 OpenToM)上进行测试来系统评估。我们的发现表明,小规模 LLM 在开发通用 ToM 能力方面困难重重。虽然在分布内任务上的表现有所提高,但该能力未能转移到具有不同特征的未见 ToM 任务。此外,我们证明,长期 RL 训练会导致模型“黑客”化训练数据集的统计模式,导致在分布内数据上获得显著性能提升,但在分布外任务上的表现未变或下降。这表明所学行为是一种狭义过拟合,而非获取真正抽象 ToM 能力。

关键词

引用

@article{arxiv.2507.15788,
  title  = {Small LLMs Do Not Learn a Generalizable Theory of Mind via Reinforcement Learning},
  author = {Sneheel Sarangi and Hanan Salam},
  journal= {arXiv preprint arXiv:2507.15788},
  year   = {2025}
}