小规模 LLM 通过强化学习无法获得可泛化的心理理论
机器学习
2025-07-22 v1 人工智能
计算与语言
摘要
最近的大型语言模型 (LLM) 通过应用规则化强化学习 (RL) 进行后训练,展现出在复杂推理中的涌现能力,这引发了是否可以通过类似方法在 LLM 中植入更细腻、类似人类的社交智能(如心理理论,ToM)的疑问。本文调查小规模 LLM 是否能够通过带可验证奖励的强化学习 (RLVR) 获取鲁棒且可泛化的 ToM 能力。我们通过在各种组合的 prominent ToM 数据集(HiToM、ExploreToM、FANToM)上训练模型,并在保留的 held-out 数据集(例如 OpenToM)上进行测试来系统评估。我们的发现表明,小规模 LLM 在开发通用 ToM 能力方面困难重重。虽然在分布内任务上的表现有所提高,但该能力未能转移到具有不同特征的未见 ToM 任务。此外,我们证明,长期 RL 训练会导致模型“黑客”化训练数据集的统计模式,导致在分布内数据上获得显著性能提升,但在分布外任务上的表现未变或下降。这表明所学行为是一种狭义过拟合,而非获取真正抽象 ToM 能力。
引用
@article{arxiv.2507.15788,
title = {Small LLMs Do Not Learn a Generalizable Theory of Mind via Reinforcement Learning},
author = {Sneheel Sarangi and Hanan Salam},
journal= {arXiv preprint arXiv:2507.15788},
year = {2025}
}