GAMBIT+:用于评估机器翻译质量估计指标中性别偏见的挑战集合
计算与语言
2025-10-09 v1
摘要
性别偏见在机器翻译 (MT) 系统中已有广泛文献记录,但在自动质量估计 (QE) 指标中则相对不受关注。现有研究表明 QE 指标也可能 exhibits 性别偏见,但大多数分析受限于小型数据集、狭窄的职业覆盖范围和受限的语言 variety。为填补这一差距,我们引入了一个大规模挑战集合,专为探测 QE 指标在评估包含性别模糊职业术语的翻译时行为而设计。我们基于包含性别模糊职业英文文本的 GAMBIT 语料库,扩展了覆盖三个性别无或自然性别语言的 source 语言,以及 11 个具有语法性别语言的 target 语言, resulting in 33 个 source-target 语言对。每个 source 文本配有两个 target 版本,仅在职业术语的语法性别上不同(男性 vs. 女性),其他所有语法元素相应调整。一个无偏见的 QE 指标应为两个版本分配相等或接近相等的分数。该数据集的规模、广度和完全平行设计(所有语言中相同的文本集合对齐),使其能够按职业进行细粒度偏见分析,并在语言之间进行系统比较。
引用
@article{arxiv.2510.06841,
title = {GAMBIT+: A Challenge Set for Evaluating Gender Bias in Machine Translation Quality Estimation Metrics},
author = {Giorgos Filandrianos and Orfeas Menis Mastromichalakis and Wafaa Mohammed and Giuseppe Attanasio and Chrysoula Zerva},
journal= {arXiv preprint arXiv:2510.06841},
year = {2025}
}
备注
Accepted for publication at the 10th Conference of Machine Translation (WMT25), co-located with EMNLP 2025