中文

WMT 2020中的性别共指与偏见评测

计算与语言 2020-10-14 v1

摘要

机器翻译中的性别偏见可表现为基于虚假性别关联选择性别词形变化。例如,总是将医生译作男性、护士译作女性。随着模型日益普及并部署于商业系统中,这可能尤其有害。我们的工作针对提交至WMT、面向四种不同目标语言(捷克语、德语、波兰语和俄语)的超过19个系统,给出了该现象的最大规模证据。为此,我们使用WinoMT——一个近期用于考察从英语译至具有语法性别语言时性别共指与偏见的自动测试套件。我们将WinoMT扩展以处理WMT中测试的两种新语言:波兰语与捷克语。我们发现所有系统一致地使用数据中的虚假关联而非有意义的上下文信息。

关键词

引用

@article{arxiv.2010.06018,
  title  = {Gender Coreference and Bias Evaluation at WMT 2020},
  author = {Tom Kocmi and Tomasz Limisiewicz and Gabriel Stanovsky},
  journal= {arXiv preprint arXiv:2010.06018},
  year   = {2020}
}

备注

Accepted WMT20