RoleEval:大型语言模型的双语角色评估基准
计算与语言
2024-02-19 v2
摘要
大型语言模型的快速发展 necessitates 有效的基准测试来评估其角色知识,这对于建立与现实世界的联系并提供更沉浸式的互动至关重要。本文介绍了 RoleEval,这是一个旨在评估角色知识的记忆、利用和推理能力的双语基准。RoleEval 包含 RoleEval-Global(包括国际知名角色)和 RoleEval-Chinese(包括在中国流行的角色),共有 6,000 道中英平行多项选择题,聚焦于来自名人、动漫、漫画、电影、电视剧、游戏和小说等多个领域的 300 位有影响力的人物和虚构角色。这些问题涵盖基础知识和多跳推理能力,旨在系统地探查角色的个人信息、关系、能力和经历等各个方面。为了保持高标准,我们执行了结合自动验证和人工验证的混合质量检查流程,确保问题具有多样性、挑战性和区分度。我们在零样本和少样本设置下,使用 RoleEval 对各种开源和专有大型语言模型进行了广泛评估,揭示了深刻的发现。值得注意的是,虽然 GPT-4 在 RoleEval-Global 上优于其他模型,但中国大型语言模型在 RoleEval-Chinese 上表现卓越,突显了显著的知识分布差异。我们期望 RoleEval 能凸显在各种语言和文化背景下评估大型语言模型角色知识的重要性。
引用
@article{arxiv.2312.16132,
title = {RoleEval: A Bilingual Role Evaluation Benchmark for Large Language Models},
author = {Tianhao Shen and Sun Li and Quan Tu and Deyi Xiong},
journal= {arXiv preprint arXiv:2312.16132},
year = {2024}
}
备注
Our dataset is available at https://github.com/Magnetic2014/RoleEval