中文

EmotionQueen:用于评估大语言模型同理心的基准

计算与语言 2024-09-23 v1 人工智能

摘要

大语言模型(LLM)的情感智能在自然语言处理领域至关重要。然而,之前的研究主要关注基本情感分析任务,如情感识别,这不足以评估LLM的整体情感智能。因此,本文提出了名为EmotionQueen的新型框架,用于评估LLM的情感智能。该框架包括四个独特任务:关键事件识别、混合事件识别、隐式情感识别和意图识别。LLM被要求识别重要事件或隐式情感并生成同理心响应。我们还设计了两种指标来评估LLM在情感相关陈述的识别和响应方面的能力。实验得出了关于LLM在情感智能方面能力与局限性的显著结论。

关键词

引用

@article{arxiv.2409.13359,
  title  = {EmotionQueen: A Benchmark for Evaluating Empathy of Large Language Models},
  author = {Yuyan Chen and Hao Wang and Songzhou Yan and Sijia Liu and Yueze Li and Yi Zhao and Yanghua Xiao},
  journal= {arXiv preprint arXiv:2409.13359},
  year   = {2024}
}

备注

Accepted to ACL 2024 (Findings)