通过反事实数据生成降低机器翻译中的性别偏见
计算与语言
2023-11-29 v1
摘要
神经方法的最新进展显著提升了神经机器翻译(NMT)系统的质量。然而,这些系统常产生性别不准确的翻译(Stanovsky et al., 2019),其可溯源至训练数据中的偏见。Saunders 与 Byrne(2020)以包含均衡性别职业词的手工数据集应对该问题。通过使用该数据微调已有 NMT 模型,他们表明性别偏见可被显著缓解,尽管因灾难性遗忘而牺牲了翻译质量。他们通过改进训练目标或推理时附加模型恢复了部分损失的质量。但我们发现,仅需以基础模型训练语料的随机样本补充该手工数据集,便足以显著减少灾难性遗忘。我们还提出一种新颖的领域自适应技术,利用 Zmigrod et al.(2019)提出的反事实数据生成技术所创建的领域内数据,进一步提升在 WinoMT 挑战测试集上的准确率,且不显著损失翻译质量。我们展示了其从英语向三种形态丰富语言——法语、西班牙语与意大利语——的 NMT 系统中的有效性。相关数据集与代码将于 Github 提供。
引用
@article{arxiv.2311.16362,
title = {Reducing Gender Bias in Machine Translation through Counterfactual Data Generation},
author = {Ranjita Naik and Spencer Rarrick and Vishal Chowdhary},
journal= {arXiv preprint arXiv:2311.16362},
year = {2023}
}