GaoYao 基准:评估大语言模型多语言与多文化能力的综合框架
计算与语言
2026-04-23 v1
摘要
评估大语言模型 (LLMs) 的多语言和多文化能力对其全球实用性至关重要。然而,当前的基准面临三个关键局限:(1) 评估维度零散,常常忽略深层的文化细微差异;(2) 依赖低质量机器翻译的主观任务中语言覆盖不足;(3) 分析浅薄,缺乏超越简单排名的诊断深度。为解决这些问题,我们推出了 GaoYao,一个包含 18.23 万个样本、覆盖 26 种语言和 51 个国家/地区的综合基准。首先,GaoYao 提出了一个统一框架,将评估任务划分为三个文化层级(通用多语言、跨文化、单一文化)和九个认知子层级。其次,我们通过利用专家将主观基准严格本地化为 19 种语言,并合成 34 种文化的跨文化测试集,实现了母语级别的扩展,覆盖范围比先前最多高出 111%。第三,我们对 20 多个旗舰和紧凑型大语言模型进行了深入的诊断分析。我们的发现揭示了显著的地理性能差异和任务间的明显差距,为未来工作提供了可靠的路线图。我们发布了该基准 (https://github.com/lunyiliu/GaoYao)。
引用
@article{arxiv.2604.20225,
title = {The GaoYao Benchmark: A Comprehensive Framework for Evaluating Multilingual and Multicultural Abilities of Large Language Models},
author = {Yilun Liu and Chunguang Zhao and Mengyao Piao and Lingqi Miao and Shimin Tao and Minggui He and Chenxin Liu and Li Zhang and Hongxia Ma and Jiaxin Guo and Chen Liu and Liqun Deng and Jiansheng Wei and Xiaojun Meng and Fanyi Du and Daimeng Wei and Yanghua Xiao},
journal= {arXiv preprint arXiv:2604.20225},
year = {2026}
}
备注
Accepted by ACL 2026 main