中文

EmPO:基于情感 grounding 的倾向优化情感响应生成

计算与语言 2024-09-18 v2 人工智能

摘要

情感响应生成是对话式智能体重要的特性,对于促进人机之间富有情感的多轮对话至关重要。虽然利用大型语言模型在此任务上已展现出前景,但仍面临确保响应情感质量与维持模型泛化性能之间的挑战。我们提出一种新方法,通过基于情感 grounding 构建理论驱动的倾向数据集,并使用其对 LLMs 进行倾向优化对齐,以解决上述挑战。为评估情感响应生成,我们采用 EmpatheticDialogues 数据集,运用 diff-Epitome 与 BERTscore 指标以及多维人类评估。此外,我们还使用基于特征的方法衡量多样性与情感价值。我们还通过 MMLU 基准和 Open LLM Leaderboard 上的任务评估训练对泛化性能的影响。结果表明,LLMs 可通过倾向优化实现情感响应生成,对齐期间可保持其通用性能,且情感 grounding 可指导倾向数据集的创建。我们将所有数据集、源代码和模型公开于 https://github.com/justtherightsize/empo。

关键词

引用

@article{arxiv.2406.19071,
  title  = {EmPO: Emotion Grounding for Empathetic Response Generation through Preference Optimization},
  author = {Ondrej Sotolar and Vojtech Formanek and Alok Debnath and Allison Lahnala and Charles Welch and Lucie FLek},
  journal= {arXiv preprint arXiv:2406.19071},
  year   = {2024}
}

备注

v02, 8 pages long paper, EMNLP ACL style