中文

通过双边强化学习提升 LLM 在心理推理任务中的能力

数据库 2025-11-13 v4

摘要

大型语言模型在情感理解、社会推理和共情方面显示出潜力,但在需要推断上下文丰富、模糊情境中隐含心理状态的心理学任务上仍存在挑战。这些限制源于缺乏与心理学对齐的监督信号,以及难以在真实世界叙事中捕捉细腻的心理过程。为此,我们利用专家标注的心理学丰富场景,提出一种基于轨迹的强化学习框架,显式模仿专家心理思考模式。通过将真实刺激与结构化推理指导相结合,我们的方法使紧凑型模型内化社会认知原则,进行细致的心理推断,并支持持续自我改进。广泛的实验表明,我们的模型在多个基准测试上实现了专家水平的解释能力,展现出强大的跨分布 generalization 和在多样化、具有挑战性且心理学丰富的任务上的稳健持续学习能力。

关键词

引用

@article{arxiv.2508.02458,
  title  = {From Stimuli to Minds: Enhancing Psychological Reasoning in LLMs via Bilateral Reinforcement Learning},
  author = {Yichao Feng and Haoran Luo and Lang Feng and Shuai Zhao and Anh Tuan Luu},
  journal= {arXiv preprint arXiv:2508.02458},
  year   = {2025}
}