中文

评估语言翻译中人机对等的一组建议

计算与语言 2020-04-06 v1 人工智能

摘要

过去几年中,机器翻译的质量显著提高,以至于在多项实证调查中发现其与专业人工翻译难以区分。我们重新评估了 Hassan 等人 2018 年关于中译英新闻翻译的调查,表明人机对等的结论归因于评估设计的缺陷——该评估设计目前被认为是该领域的最佳实践。我们表明,专业人工翻译包含的错误显著更少,且人工评估中感知到的质量取决于评分者的选择、语言上下文的可用性以及参考翻译的创建。我们的结果呼吁重新审视当前的通用最佳实践,以评估强大的机器翻译系统,特别是人机对等,为此我们基于实证发现提供了一组建议。

关键词

引用

@article{arxiv.2004.01694,
  title  = {A Set of Recommendations for Assessing Human-Machine Parity in Language Translation},
  author = {Samuel Läubli and Sheila Castilho and Graham Neubig and Rico Sennrich and Qinlan Shen and Antonio Toral},
  journal= {arXiv preprint arXiv:2004.01694},
  year   = {2020}
}