观察观察者:暴露机器翻译质量评估中的性别差异
计算与语言
2025-06-04 v4
摘要
质量评估(QE)——即对翻译质量的自动评估——近期在翻译流程的多个阶段(从数据 curated 到训练和解码)中发挥着至关重要的作用。虽然 QE 指标已被优化以与人类判断一致,但它们是否编码了社会偏见尚未得到广泛关注。偏见的 QE 可能使某些人口统计学群体在可见性和可用性方面受到优势。本文定义并研究了 QE 指标的性别偏见,并讨论了其对机器翻译(MT)的下游影响。实验使用最先进的 QE 指标跨多个领域、数据集和语言,揭示了显著偏见。当人类实体的性别在源文本中未被揭示时, masculine-inflected 翻译得分高于 feminine-inflected 翻译,性别中性翻译则受到惩罚。即使在上下文线索明确性别时,使用基于上下文的 QE 指标也会导致针对女性指代的翻译变形选择错误率高于男性指代。此外,偏见的 QE 指标还会影响数据过滤和质量感知解码。我们的发现凸显了需要关注开发和以性别为中心的 QE 指标评估的重要性。
引用
@article{arxiv.2410.10995,
title = {Watching the Watchers: Exposing Gender Disparities in Machine Translation Quality Estimation},
author = {Emmanouil Zaranis and Giuseppe Attanasio and Sweta Agrawal and André F. T. Martins},
journal= {arXiv preprint arXiv:2410.10995},
year = {2025}
}
备注
ACL 2025