GIEBench: 面向大型语言模型的群体身份基于同理心的全面评估基准
人工智能
2024-06-25 v2
摘要
随着大型语言模型(Large Language Model, LLM)不断发展并获得广泛应用,评估LLM对多样化群体身份的同理心能力,以及理解其视角的能力日益受到重视。现有大多数LLM同理心评估基准主要关注普遍的人类情感,如悲伤和疼痛,往往忽视个体群体身份的情境。为弥合这一差距,我们引入GIEBench,一个包含11个身份维度、覆盖97个群体身份、总计999个关于特定群体身份的单选问题的全面基准测试。GIEBench旨在评估LLM在面对特定群体身份(如性别、年龄、职业、种族)时的同理心,强调其从该身份立场进行回应的能力。这支持开发针对不同身份用户的具有同理心的LLM应用。我们的评估发现,23个LLM虽然理解不同身份的立场,却未能在这些身份之间始终表现出均等的同理心,除非明确指示采取这些视角。这一发现凸显了需要改进LLM与多样化价值观相结合,以更好地适应人类身份的多面性。我们的数据集已发布于https://github.com/GIEBench/GIEBench。
引用
@article{arxiv.2406.14903,
title = {GIEBench: Towards Holistic Evaluation of Group Identity-based Empathy for Large Language Models},
author = {Leyan Wang and Yonggang Jin and Tianhao Shen and Tianyu Zheng and Xinrun Du and Chenchen Zhang and Wenhao Huang and Jiaheng Liu and Shi Wang and Ge Zhang and Liuyu Xiang and Zhaofeng He},
journal= {arXiv preprint arXiv:2406.14903},
year = {2024}
}