中文

基于LLM评估器的可扩展性别中性翻译评估方法

计算与语言 2025-04-17 v1

摘要

性别中性翻译(GNT)旨在避免表达人称指代的性别,而源文本 lacks 对这些指代的性别信息。自动评估GNT尤其具有挑战性,现有解决方案局限于单语分类器。此类解决方案并非理想选择,因为它们未考虑源句子且需要专门数据和微调才能扩展到新语言。本文通过研究大型语言模型(LLM)作为GNT评估器来解决此限制问题。具体而言,我们探讨两种提示方法:一种是LLM仅生成句子级评估,另一种类似链式思维方法,即LLM首先生成详细的词语级注释,然后进行句子级判断。在针对多个语言进行的大量实验中使用五个模型(包括开源和专有模型),我们展示了LLM可以作为GNT评估器。此外,我们发现对词语级注释再进行句子级评估的提示方法始终提高了所有模型的准确率,为当前解决方案提供了更好的可扩展替代方案。

关键词

引用

@article{arxiv.2504.11934,
  title  = {An LLM-as-a-judge Approach for Scalable Gender-Neutral Translation Evaluation},
  author = {Andrea Piergentili and Beatrice Savoldi and Matteo Negri and Luisa Bentivogli},
  journal= {arXiv preprint arXiv:2504.11934},
  year   = {2025}
}

备注

Accepted at GITT 2025