中文

基于心理学的情感奖励建模:PERM

计算与语言 2026-01-19 v2

摘要

大型语言模型(LLM)日益被部署于以人为中心的应用中,但常常未能提供实质性的情感支持。虽然强化学习(RL)被用于增强LLM的情感表达,但现有的奖励模型通常从单一视角评估情感表达,忽视了依据同理心循环理论(Empathy Cycle theory)所定义的、在支持者和寻求者之间天然双向互动的本质。为此,我们提出了心理学依据的情感奖励建模(PERM)。PERM通过双向分解来实现情感表达评估:1)从支持者视角评估内在共鸣和交际表达;2)从寻求者视角评估情感接收。此外,它还包含旁观者视角以监控整体互动质量。在广泛使用的情感智能基准和工业日常对话数据集上的大量实验表明,PERM相对于最先进的基线方法超过了10%。此外,一次盲选用户研究显示,我们的方法受到70%的偏好,凸显了其在生成更具同理心的响应方面的有效性。我们的代码、数据集和模型已在 https://github.com/ZhengWwwq/PERM 上提供。

关键词

引用

@article{arxiv.2601.10532,
  title  = {PERM: Psychology-grounded Empathetic Reward Modeling for Large Language Models},
  author = {Chengbing Wang and Wuqiang Zheng and Yang Zhang and Fengbin Zhu and Junyi Cheng and Yi Xie and Wenjie Wang and Fuli Feng},
  journal= {arXiv preprint arXiv:2601.10532},
  year   = {2026}
}