中文

通过参照透明性测试机器翻译

计算与语言 2021-03-02 v2 软件工程

摘要

近年来,由于深度神经网络的进步,机器翻译软件取得了快速发展。人们在日常生活中 routinely 使用机器翻译软件,例如在外语餐厅点餐、接受外国医生的医疗诊断与治疗、以及在线阅读国际政治新闻。然而,由于底层神经网络的复杂性与难处理性,现代机器翻译软件仍远非鲁棒,并可能产生糟糕或不正确的翻译;这可能导致误解、财务损失、对个人安全与健康的威胁以及政治冲突。为解决此问题,我们引入参照透明输入(RTIs),一种简单、广泛适用的验证机器翻译软件的方法。参照透明输入是一段在不同语境中使用时应具有相似翻译的文本。我们的实际实现Purity可检测翻译何时破坏了该性质。为评估RTI,我们使用Purity以200条无标注句子测试Google Translate和Bing Microsoft Translator,分别以高精度(79.3%和78.3%)检测出123和142个错误翻译。这些翻译错误多种多样,包括欠翻译、过翻译、词/短语误译、错误修饰以及逻辑不清等例子。

关键词

引用

@article{arxiv.2004.10361,
  title  = {Testing Machine Translation via Referential Transparency},
  author = {Pinjia He and Clara Meister and Zhendong Su},
  journal= {arXiv preprint arXiv:2004.10361},
  year   = {2021}
}

备注

Accepted by ICSE21