利用目标语性别标注缓解机器翻译中的性别偏见
计算与语言
2020-10-20 v2
摘要
当将“The secretary asked for details.”翻译到具有语法性别的语言时,可能需要确定主语“secretary”的性别。如果句子不包含必要信息,则并不总是能够消歧。在此类情况下,机器翻译系统会选择最常见的翻译选项,这通常对应于刻板印象翻译,从而可能加剧对某些群体和人的偏见与边缘化。我们认为,充分翻译所需的信息并非总能从待译句中推导出来,甚至可能依赖于外部知识。因此,在这项工作中,我们提议将获取必要信息的任务与在信息可用时学习正确翻译的任务解耦。为此,我们提出了一种训练机器翻译系统以使用包含主语性别信息的词级标注的方法。为准备训练数据,我们用对应目标语言词的语法性别信息标注常规的源语言词。使用此类数据训练机器翻译系统,可在主语性别信息可用时减少其对性别刻板印象的依赖。我们在五组语言对上的实验表明,这能将 WinoMT 测试集上的准确率提高至多 25.8 个百分点。
引用
@article{arxiv.2010.06203,
title = {Mitigating Gender Bias in Machine Translation with Target Gender Annotations},
author = {Artūrs Stafanovičs and Toms Bergmanis and Mārcis Pinnis},
journal= {arXiv preprint arXiv:2010.06203},
year = {2020}
}
备注
EMNLP 2020 Fifth Conference on Machine Translation (WMT20)