中文

ESC-Eval:评估大语言模型中的情感支持对话

计算与语言 2024-10-29 v3

摘要

情感支持对话(ESC)是一项关键应用,旨在减轻人类压力、提供情感指导,并最终提升人类的心理与身体福祉。随着大型语言模型(LLM)的发展,许多研究者开始将 LLM 作为 ESC 模型。然而,这些基于 LLM 的 ESC 评估仍不确定。鼓舞于角色扮演代理的最新发展,我们提出了 ESC 评估框架(ESC-Eval),该框架使用角色扮演代理与 ESC 模型进行交互,随后对交互式对话进行人工评估。具体而言,我们首先从七个现有数据集中重新组织 2,801 张角色卡,以定义角色扮演代理的角色。其次,我们训练一个名为 ESC-Role 的特定角色扮演模型,其行为类似于困惑的 GPT-4。随后,通过 ESC-Role 和组织好的角色卡,我们系统性地使用 14 个 LLM 作为 ESC 模型进行实验,包括通用 AI 助理 LLM(ChatGPT)和 ESC 导向 LLM(ExTES-Llama)。我们对不同 ESC 模型的交互式多轮对话进行全面的人工标注。结果表明,ESC 导向 LLM 在 ESC 能力方面优于通用 AI 助理 LLM,但仍与人类水平存在差距。此外,为了自动化未来 ESC 模型的评分过程,我们开发了 ESC-RANK,该模型在标注数据上进行训练,评分性能超过 GPT-4 35 分。我们的数据和代码均已公开于 https://github.com/AIFlames/Esc-Eval。

关键词

引用

@article{arxiv.2406.14952,
  title  = {ESC-Eval: Evaluating Emotion Support Conversations in Large Language Models},
  author = {Haiquan Zhao and Lingyu Li and Shisong Chen and Shuqi Kong and Jiaan Wang and Kexin Huang and Tianle Gu and Yixu Wang and Wang Jian and Dandan Liang and Zhixu Li and Yan Teng and Yanghua Xiao and Yingchun Wang},
  journal= {arXiv preprint arXiv:2406.14952},
  year   = {2024}
}

备注

EMNLP 2024