中文

情感麻木还是共情?使用 EmotionBench 评估 LLM 的感受

计算与语言 2024-10-08 v6

摘要

评估大语言模型 (LLM) 的拟人能力在当代讨论中变得日益重要。利用心理学中的情绪评估理论,我们提出评估 LLM 的共情能力,即其在面对特定情境时感受如何变化。经过仔细且全面的调研,我们收集了一个包含 400 多个已被证明能有效引发本研究关注的八种情绪的数据集。将情境归类为 36 个因素,我们开展了涉及全球超过 1,200 名受试者的人类评估。以人类评估结果作为参考,我们的评估涵盖七个 LLM,包括商业和开源模型,含不同模型规模变体,以及最新迭代如 GPT-4、Mixtral-8x22B 和 LLaMA-3.1。我们发现,尽管存在若干错位,LLM 通常能对某些情境做出恰当响应。然而,它们在与人类情绪行为的对齐上有所不足,且无法在相似情境间建立联系。我们收集的情境数据集、人类评估结果以及测试框架代码(即 EmotionBench)公开于 https://github.com/CUHK-ARISE/EmotionBench。

关键词

引用

@article{arxiv.2308.03656,
  title  = {Emotionally Numb or Empathetic? Evaluating How LLMs Feel Using EmotionBench},
  author = {Jen-tse Huang and Man Ho Lam and Eric John Li and Shujie Ren and Wenxuan Wang and Wenxiang Jiao and Zhaopeng Tu and Michael R. Lyu},
  journal= {arXiv preprint arXiv:2308.03656},
  year   = {2024}
}

备注

NeurIPS 2024; 10 pages of main text; 14 pages of appendices