MuBench:跨 61 种语言大语言模型多语言能力评估基准
计算与语言
2025-06-25 v1 人工智能
摘要
多语言大语言模型(LLM)正快速发展,新模型常声称支持越来越多的语言。然而,现有评估数据集受限,缺乏跨语言对齐,致使多语言能力评估在语言和技能覆盖上呈碎片化。为此,我们引入 MuBench,一个覆盖 61 种语言并评估广泛能力范围的基准。我们评估了多些前沿多语言 LLM,发现声称的语言覆盖与实际能力之间存在显著差距,尤其在英语与低资源语言之间表现持续存在差距。借助 MuBench 的对齐方式,我们提出了作为准确性互补指标的多语言一致性(Multilingual Consistency, MLC),用于分析性能瓶颈并指导模型改进。最终,我们在英语和中文上预训练了 1.2B 参数模型,变异语言比例和平行数据比例,以探索跨语言迁移动力学。
引用
@article{arxiv.2506.19468,
title = {MuBench: Assessment of Multilingual Capabilities of Large Language Models Across 61 Languages},
author = {Wenhan Han and Yifan Zhang and Zhixun Chen and Binbin Liu and Haobin Lin and Bingni Zhang and Taifeng Wang and Mykola Pechenizkiy and Meng Fang and Yin Zheng},
journal= {arXiv preprint arXiv:2506.19468},
year = {2025}
}