中文

基于强化学习的人类情感水平对齐用于共情响应生成

计算与语言 2025-03-04 v3 人工智能

摘要

共情响应生成旨在理解用户的处境与情感,并提供共情回应,是构建类人对话系统的关键。传统方法通常在训练过程中采用最大似然估计作为优化目标,却未能在生成响应与目标响应之间实现情感水平的对齐。为此,本文提出一种基于强化学习的共情响应生成框架(EmpRL)。该框架构建有效的情感奖励函数,通过强化学习最大化预期奖励来生成共情响应。EmpRL 利用预训练的 T5 模型作为生成器,并进一步微调以初始化策略。为在给定语境下对齐生成响应与目标响应的情感水平,构建包含情感反应、解释与探索三种情感交流机制的情感奖励函数,采用预设计和预训练的情感识别器实现。 During 强化学习训练过程中,采用近端策略优化算法对策略进行微调,实现共情响应的生成。通过自动评估与人类评估,结果表明所提出的 EmpRL 框架显著提升了生成响应的质量,增强了生成响应与目标响应之间的情感水平相似性,生成的共情响应涵盖情感与认知两个层面。

关键词

引用

@article{arxiv.2408.02976,
  title  = {Empathy Level Alignment via Reinforcement Learning for Empathetic Response Generation},
  author = {Hui Ma and Bo Zhang and Bo Xu and Jian Wang and Hongfei Lin and Xiao Sun},
  journal= {arXiv preprint arXiv:2408.02976},
  year   = {2025}
}

备注

Accepted by IEEE Transactions on Affective Computing