探究训练数据分布与子词分词对机器翻译中性别偏见的影响
计算与语言
2023-10-03 v2 人工智能
摘要
我们研究了分词对机器翻译中性别偏见的影响,这是以往工作很大程度上忽视的一个方面。具体而言,我们关注训练数据中带性别职业名称的出现频率、其在子词分词器词表中的表示,以及性别偏见之间的相互作用。我们观察到,职业名称的女性及非刻板性别变形(例如西班牙语中表示“女医生”的“doctora”)往往被切分为多个子词词元。我们的结果表明,模型训练语料中性别形式的失衡是导致性别偏见的主要因素,其影响大于子词切分。我们证明,分析子词切分能够很好地估计训练数据中性别形式的失衡,即使在语料未公开时也可使用。我们还表明,仅微调词嵌入层即可缩小女性与男性形式在性别预测准确率上的差距,且不损害翻译质量。
引用
@article{arxiv.2309.12491,
title = {Exploring the Impact of Training Data Distribution and Subword Tokenization on Gender Bias in Machine Translation},
author = {Bar Iluz and Tomasz Limisiewicz and Gabriel Stanovsky and David Mareček},
journal= {arXiv preprint arXiv:2309.12491},
year = {2023}
}
备注
Accepted to AACL 2023