OMGEval:面向大型语言模型的开源多语言生成式评估基准
计算与语言
2026-02-02 v2
摘要
现代大型语言模型(LLM)通常应惠及世界各地不同文化背景的个人。然而,最近为LLM定制的大多数先进生成式评估基准主要关注英语。为此,我们引入了OMGEval,这是首个开源的多语言生成式测试集,能够评估LLM在不同语言中的能力。对于每种语言,OMGEval提供了804个开放式问题,涵盖了LLM的广泛重要能力,如常识、逻辑推理等。每个问题都经过人工标注者的严格验证。值得注意的是,为了充分反映LLM在不同文化背景下的兼容性,我们对每种非英语语言进行了本地化。具体而言,当前版本的OMGEval包括5种语言(即中文、俄语、法语、西班牙语、阿拉伯语)。遵循AlpacaEval,我们采用GPT-4作为评判者来自动评分不同模型的输出,这被证明与人工评估密切相关。我们在提出的OMGEval上评估了几个有代表性的多语言LLM,相信这将为社区进一步理解和提高LLM的多语言能力提供有价值的参考。OMGEval可在https://github.com/blcuicall/OMGEval获取。
引用
@article{arxiv.2402.13524,
title = {OMGEval: An Open Multilingual Generative Evaluation Benchmark for Large Language Models},
author = {Yang Liu and Meng Xu and Shuo Wang and Liner Yang and Haoyu Wang and Zhenghao Liu and Cunliang Kong and Yun Chen and Yang Liu and Maosong Sun and Erhong Yang},
journal= {arXiv preprint arXiv:2402.13524},
year = {2026}
}