通过双边强化学习提升 LLM 在心理推理任务中的能力
数据库
2025-11-13 v4
摘要
大型语言模型在情感理解、社会推理和共情方面显示出潜力,但在需要推断上下文丰富、模糊情境中隐含心理状态的心理学任务上仍存在挑战。这些限制源于缺乏与心理学对齐的监督信号,以及难以在真实世界叙事中捕捉细腻的心理过程。为此,我们利用专家标注的心理学丰富场景,提出一种基于轨迹的强化学习框架,显式模仿专家心理思考模式。通过将真实刺激与结构化推理指导相结合,我们的方法使紧凑型模型内化社会认知原则,进行细致的心理推断,并支持持续自我改进。广泛的实验表明,我们的模型在多个基准测试上实现了专家水平的解释能力,展现出强大的跨分布 generalization 和在多样化、具有挑战性且心理学丰富的任务上的稳健持续学习能力。
引用
@article{arxiv.2508.02458,
title = {From Stimuli to Minds: Enhancing Psychological Reasoning in LLMs via Bilateral Reinforcement Learning},
author = {Yichao Feng and Haoran Luo and Lang Feng and Shuai Zhao and Anh Tuan Luu},
journal= {arXiv preprint arXiv:2508.02458},
year = {2025}
}