MM-Eval:面向LLM评判模型和奖励模型的多语言元评估基准
计算与语言
2025-04-01 v2
摘要
随着大型语言模型(LLM)现在能够生成英语以外语言的流畅连贯内容,精确评估这些非英语输出变得至关重要。然而,在评估多语言LLM的输出时,先前的工作通常采用擅长评估英语输出的基于LLM的评估器,而没有彻底检查这些评估器是否也能有效评估非英语文本。此外,现有的用于测试评估器LLM的基准(称为“元评估基准”)大多以英语为中心。为弥补这一差距并检验评估器LLM能否可靠地评估多语言LLM的输出,我们引入了MM-Eval,一个多语言元评估基准,包含覆盖18种语言的五个核心子集和一个覆盖122种语言的语言一致性子集。MM-Eval的一个核心属性是,它并非简单翻译现有的英语元评估基准,而是针对多语言特有的挑战而设计。此外,与仅关注成对数据排序准确性的现有元评估基准不同,MM-Eval还评估了广泛语言范围内绝对分数值的一致性和公平性。我们的结果表明,现有的在英语语境中表现出色的评估器LLM在评估非英语输出时仍有相当大的改进空间。此外,我们发现评估器在评估资源较少的语言时存在不公平和不一致的问题。最后,我们通过测量MM-Eval与Best-of-N排名的相关性来验证它,发现与其他元评估基准相比,其相关性显著更强。我们公开发布了我们的基准和代码。
引用
@article{arxiv.2410.17578,
title = {MM-Eval: A Multilingual Meta-Evaluation Benchmark for LLM-as-a-Judge and Reward Models},
author = {Guijin Son and Dongkeun Yoon and Juyoung Suk and Javier Aula-Blasco and Mano Aslan and Vu Trong Kim and Shayekh Bin Islam and Jaume Prats-Cristià and Lucía Tormo-Bañuelos and Seungone Kim},
journal= {arXiv preprint arXiv:2410.17578},
year = {2025}
}
备注
work in progress