中文

大型语言模型在情感回应方面是否比人类更具同理心?

计算与语言 2024-06-10 v1

摘要

随着大型语言模型(LLM)的出现,探讨它们是否能在情感识别和同理心回应等领域超越人类已成为研究的焦点。本文提出了一项全面研究,探讨了四种最新LLM(GPT-4、LLaMA-2-70B-Chat、Gemini-1.0-Pro和Mixtral-8x7B-Instruct)在情感回应能力方面的表现,并将其与人类基准进行比较。我们邀请1000名参与者进行跨主语用户研究,评估了人类和四种LLM对2000个精心挑选的情感对话提示所作出的回应的同理心质量。这些情感对话提示涵盖了32种不同的积极和消极情感。我们的发现表明,LLM的情感回应能力在统计上显著优于人类。GPT-4在被评价为"良好"的回应方面显著优于人类基准,提升约31%。其后是LLaMA-2、Mixtral-8x7B和Gemini-Pro,分别在"良好"评级方面提升约24%、21%和10%。我们进一步对回应评级进行更细粒度的分析,发现某些LLM在回应特定情感方面显著优于其他情感。该建议的评估框架提供了一种可扩展且可适应的方法,用于评估新LLM的同理心,避免在未来研究中复制本研究的发现。

关键词

引用

@article{arxiv.2406.05063,
  title  = {Are Large Language Models More Empathetic than Humans?},
  author = {Anuradha Welivita and Pearl Pu},
  journal= {arXiv preprint arXiv:2406.05063},
  year   = {2024}
}

备注

9 pages, 3 figures. arXiv admin note: text overlap with arXiv:2403.05572