中文

多语言 LLM 评判器的可靠性如何?

计算与语言 2025-05-20 v1

摘要

LLM 评判器作为一种新兴的评估策略,已广泛应用于大型语言模型对生成结果进行人类指令对齐评估。虽然这些模型作为人类标注员的有前景替代方案,但其在多语言评估中的可靠性尚存疑虑。为弥合这一差距,本文对多语言 LLM 评判器进行全面分析。具体而言,我们评估了来自不同模型家族的五个模型,在涉及 25 种语言的五个多样化任务中的表现。我们的发现表明,LLM 在跨语言一致性方面存在挑战,平均 Fleiss' Kappa 约为 0.3,且部分模型表现更差。为探究不一致性原因,我们分析了 various 影响因素。我们观察到一致性在不同语言间差异显著,尤其在低资源语言中表现尤为不佳。此外,我们发现无论是通过多语言数据训练还是增加模型规模,都无法直接提高判决一致性。这些发现表明,LLM 尚不可靠用于评估多语言预测。最后,我们提出一种集成策略,可在实际应用中提高多语言评判器的一致性。

关键词

引用

@article{arxiv.2505.12201,
  title  = {How Reliable is Multilingual LLM-as-a-Judge?},
  author = {Xiyan Fu and Wei Liu},
  journal= {arXiv preprint arXiv:2505.12201},
  year   = {2025}
}