中文

EQ-Bench:面向大语言模型的情商基准测试

计算与语言 2024-01-04 v2 人工智能

摘要

我们引入了EQ-Bench,一个旨在评估大语言模型(LLMs)情商方面能力的新型基准测试。通过要求模型预测对话中角色情绪状态的强度,我们评估LLMs理解复杂情绪和社交互动的能力。该基准测试能够有效区分广泛的模型。我们发现EQ-Bench与全面的多领域基准测试(如MMLU(Hendrycks et al., 2020))强相关(r=0.97),表明我们可能捕捉到了广义智能的相似方面。我们的基准测试使用一组60个英语问题,产生高度可重复的结果。我们还在https://github.com/EQ-bench/EQ-Bench提供了用于自动化基准测试流程的开源代码,并在https://eqbench.com提供了排行榜。

关键词

引用

@article{arxiv.2312.06281,
  title  = {EQ-Bench: An Emotional Intelligence Benchmark for Large Language Models},
  author = {Samuel J. Paech},
  journal= {arXiv preprint arXiv:2312.06281},
  year   = {2024}
}