中文

面向低资源机器翻译的 Pointer-Generator Networks:请勿复制!

计算与语言 2024-06-19 v3

摘要

虽然基于 Transformer 的神经机器翻译 (NMT) 在高资源设置下非常有效,但许多语言缺乏必要的大型平行语料库来从中受益。在两种密切相关的语言之间的低资源 (LR) 机器翻译背景下,一种自然的直觉是寻求从结构“捷径”中获益,例如将子词从源端复制到目标端,因为此类语言对通常共享大量相同的词、同源词和借词。为此,我们在多种资源范围内针对六种语言对测试了 Pointer-Generator Networks,并发现大多数设置下有微弱的改进。然而,分析表明,对于密切相关的语言对与较远的语言对相比,或在更低的资源范围内,该模型并未表现出更大的改进,且模型并未表现出对共享子词使用该机制的预期行为。我们对这种行为原因的讨论突出了 LR NMT 面临的若干普遍挑战,如现代分词策略、嘈杂的真实世界条件以及语言复杂性。鉴于 Transformer 模型的黑箱性质,我们呼吁对 NMT 中受语言学启发的改进进行更严格的审查,并呼吁该领域关注上述问题。

关键词

引用

@article{arxiv.2403.10963,
  title  = {Pointer-Generator Networks for Low-Resource Machine Translation: Don't Copy That!},
  author = {Niyati Bafna and Philipp Koehn and David Yarowsky},
  journal= {arXiv preprint arXiv:2403.10963},
  year   = {2024}
}

备注

5 pages, Accepted at Workshop on Insights from Negative Results in NLP (NAACL) 2024