中文

神经机器翻译、语料库与节俭性

计算与语言 2021-01-27 v1

摘要

在机器翻译领域,学术界与工业界都对日益强大的系统表现出不断增长兴趣,这些系统使用数亿至数十亿例的语料库。这些系统代表了当前最优(state-of-the-art)。在此我们捍卫并行开发使用相对小语料库训练的“节俭”双语翻译系统的理念。基于对标准人类职业译者的观察,我们估计语料库最多应由源语言 7500 万例的单语子语料库、目标语言 600 万例的第二单语子语料库,以及 600 万双例的对齐双语子语料库组成。一个较不理想的替代方案将是 4750 万双例的对齐双语语料库。

关键词

引用

@article{arxiv.2101.10650,
  title  = {Neural machine translation, corpus and frugality},
  author = {Raoul Blin},
  journal= {arXiv preprint arXiv:2101.10650},
  year   = {2021}
}