在神经机器翻译中正确处理性别信息
计算与语言
2019-09-12 v1
摘要
不同语言的说话者必须注意并编码世界中截然不同的方面才能正确使用其语言(Sapir, 1921; Slobin, 1996)。其中一个差异与语言中性别的表达方式有关。在英语中说"I am happy",并不编码说出该句的说话者的任何额外信息。然而,许多其他语言确实具有语法性系统,因此此类知识会被编码。为了将该句正确翻译为例如法语,需要保留/恢复内在的性别信息。同一句子对于男性说话者变为"Je suis heureux",对于女性说话者变为"Je suis heureuse"。除形态一致外,人口统计因素(性别、年龄等)也影响我们对语言的使用,体现在词语选择甚至句法结构层面(Tannen, 1991; Pennebaker et al., 2003)。我们将性别信息整合进NMT系统。我们的贡献有两方面:(1) 为20个语言对编译带有说话者信息的大型数据集,(2) 一组将性别信息整合进多语言对NMT的简单实验。我们的实验表明,向NMT系统添加性别特征显著提升了某些语言对的翻译质量。
引用
@article{arxiv.1909.05088,
title = {Getting Gender Right in Neural Machine Translation},
author = {Eva Vanmassenhove and Christian Hardmeier and Andy Way},
journal= {arXiv preprint arXiv:1909.05088},
year = {2019}
}
备注
Proceedings of the 2018 Conference on Empirical Methods in Natural Language Processing (EMNLP), October-November, 2018. Brussels, Belgium, pages 3003-3008, URL: https://www.aclweb.org/anthology/D18-1334, DOI: 10.18653/v1/D18-1334