中文

AUGVIC:利用双语文本邻域的低资源神经机器翻译

计算与语言 2021-06-10 v1

摘要

神经机器翻译(NMT)的成功在很大程度上依赖于大规模双语文本训练语料的可获得性。由于低资源语言对缺乏此类大规模语料,NMT 系统常表现出较差的性能。额外的相关单语数据通常有所帮助,但其获取可能相当昂贵,尤其对于低资源语言。此外,双语文本(训练/测试)与单语数据之间的领域不匹配可能降低性能。为缓解此类问题,我们提出 AUGVIC,一种用于低资源 NMT 的新型数据增广框架,它利用给定双语文本的邻域样本,而无需显式使用任何额外单语数据。它能在更细粒度控制下使领域内双语文本数据多样化。通过在包含不同领域数据的四个低资源语言对上进行大量实验,我们表明我们的方法与使用额外领域内单语数据的传统回译相当。当我们将 AUGVIC 生成的合成平行数据与来自额外单语数据的数据结合时,我们取得了进一步的改进。我们表明 AUGVIC 有助于减弱传统回译中相关与远领域单语数据之间的差异。为理解 AUGVIC 不同组件的贡献,我们进行了深入的框架分析。

关键词

引用

@article{arxiv.2106.05141,
  title  = {AUGVIC: Exploiting BiText Vicinity for Low-Resource NMT},
  author = {Tasnim Mohiuddin and M Saiful Bari and Shafiq Joty},
  journal= {arXiv preprint arXiv:2106.05141},
  year   = {2021}
}

备注

ACL-2021 accepted paper