中文

用于口语化神经机器翻译的源语言合成增强

计算与语言 2021-01-01 v1 机器学习

摘要

神经机器翻译(NMT)通常依赖于领域与风格,且需要大量训练数据。最先进的 NMT 模型往往难以处理其源语言的口语化变体,而在这方面平行数据的缺乏是系统性改进现有模型的一大挑战。本工作中,我们构建了一个从 YouTube 字幕与 Twitter 收集的印尼语口语–英语新型测试集。我们对正式印尼语源语言进行合成风格增强,并表明其在新测试数据上提升了基线 Id-En 模型(以 BLEU 计)的表现。

关键词

引用

@article{arxiv.2012.15178,
  title  = {Synthetic Source Language Augmentation for Colloquial Neural Machine Translation},
  author = {Asrul Sani Ariesandy and Mukhlis Amien and Alham Fikri Aji and Radityo Eko Prasojo},
  journal= {arXiv preprint arXiv:2012.15178},
  year   = {2021}
}

备注

5 pages