M-Prometheus:一套开源多语言 LLM 评判器
计算与语言
2025-10-31 v2 人工智能
摘要
使用语言模型自动评估长文本(LLM-as-a-judge)正变得日益普遍,但大多数 LLM 评判器仅针对英语进行优化,而在当前文献中,增强其多语言评估能力的策略在很大程度上尚未被探索。这导致了非英语语言自动评估方法的质量差异,最终阻碍了具有更好多语言能力的模型的开发。为了弥合这一差距,我们引入了 M-Prometheus,这是一套参数量从 3B 到 14B 的开源 LLM 评判器,能够对多语言输出提供直接评估和成对比较反馈。M-Prometheus 模型在涵盖 20 多种语言的多语言奖励基准以及涵盖 4 个语言对的文学机器翻译(MT)评估中,均优于最先进的开源 LLM 评判器。此外,M-Prometheus 模型可在解码时被利用,以显著改善所有 3 种测试语言的生成输出,展示了它们对于开发更优多语言模型的效用。最后,通过广泛的消融实验,我们确定了获得有效多语言评判器的关键因素,包括骨干模型的选择以及在合成多语言反馈数据而非翻译数据上进行训练。我们发布了我们的模型、训练数据集和代码。
引用
@article{arxiv.2504.04953,
title = {M-Prometheus: A Suite of Open Multilingual LLM Judges},
author = {José Pombal and Dongkeun Yoon and Patrick Fernandes and Ian Wu and Seungone Kim and Ricardo Rei and Graham Neubig and André F. T. Martins},
journal= {arXiv preprint arXiv:2504.04953},
year = {2025}
}