中文

英汉机器翻译的细粒度人工评价:以科学文本为例

计算与语言 2021-10-29 v1

摘要

近期研究表明,新闻领域的神经机器翻译(MT)已达到人类水平表现,但在其他专业领域则远未达到。本文针对从已发表期刊与书籍中收集的科学摘要,对四个广泛使用的英汉NMT系统进行细粒度系统性人工评价。我们的人工评价结果显示,所有系统的平均错误率均超过10%,在实际学术使用中需要大量译后编辑工作。此外,我们将错误归为六类主要类型并给出若干真实示例。我们的发现强调,MT界的研究关注点应从短文本通用翻译转向专业机器翻译,并为这些特定领域构建大规模双语语料库。

关键词

引用

@article{arxiv.2110.14766,
  title  = {Fine Grained Human Evaluation for English-to-Chinese Machine Translation: A Case Study on Scientific Text},
  author = {Ming Liu and He Zhang and Guanhao Wu},
  journal= {arXiv preprint arXiv:2110.14766},
  year   = {2021}
}

备注

12 pages, 3 tables