“我”迷失在翻译中:众包数据集里的代词失误
计算与语言
2023-04-27 v1 计算机与社会
人机交互
机器学习
摘要
随着虚拟助手在全球范围内的持续普及,这些基于语音的系统越来越需要在多种语言中自然沟通。众包倡议聚焦于大型开放数据集的多语言翻译,以用于自然语言处理(NLP)。然而,语言翻译往往不是一一对应的,且偏见可能悄然渗入。在这项迟发工作中,我们关注众包 Tatoeba 数据库中英语与日语之间代词翻译的案例。我们发现总体上存在男性代词偏见,尽管语言的多元性已通过其他方式得到考量。重要的是,我们检测到翻译过程中反映对女性、中性和/或非二元代词存在细致反应的偏见。我们提出代词翻译偏见的问题,并给出一个将多元性嵌入 NLP 数据集的实用方案。
引用
@article{arxiv.2304.13557,
title = {"I'm" Lost in Translation: Pronoun Missteps in Crowdsourced Data Sets},
author = {Katie Seaborn and Yeongdae Kim},
journal= {arXiv preprint arXiv:2304.13557},
year = {2023}
}
备注
6 pages