中文

机器翻译体:算法偏差对机器翻译中语言复杂性的影响

计算与语言 2021-02-02 v1 人工智能 计算机与社会

摘要

机器翻译(MT)与自然语言处理(NLP)领域的近期研究已表明,现有模型会放大训练数据中观察到的偏差。语言技术中偏差的放大主要在特定现象(如性别偏差)方面被考察。在本工作中,我们超越 MT 中性别的研究,探讨偏差放大如何在更广义上影响语言。我们假设“算法偏差”(即频繁观测模式的加剧与低频模式的丢失)不仅加剧了当前数据集中存在的社会偏差,还可能导致一种人为贫乏的语言:“机器翻译体(machine translationese)”。我们评估了由不同数据驱动的 MT 范式——基于短语的统计机器翻译(PB-SMT)与神经机器翻译(NMT)——所生成译文的语言丰富度(在词汇与形态层面)。我们的实验显示,对于所有被考察的 MT 范式,在两个语言对(EN<=>FR 与 EN<=>ES)上,所产生的译文均存在词汇与形态丰富度的丢失。

关键词

引用

@article{arxiv.2102.00287,
  title  = {Machine Translationese: Effects of Algorithmic Bias on Linguistic Complexity in Machine Translation},
  author = {Eva Vanmassenhove and Dimitar Shterionov and Matthew Gwilliam},
  journal= {arXiv preprint arXiv:2102.00287},
  year   = {2021}
}