拼接数据增强在低资源翻译中的作用机制探秘与对策
计算与语言
2021-07-05 v2
摘要
在本文中,我们研究了拼接这一用于低资源神经机器翻译的简单而有效的数据增强方法背后的驱动因素。我们的实验表明,跨四个语言对的约 +1 BLEU 的提升不太可能源于语篇上下文。相反,我们证明了该提升来自三个与语篇无关的其他因素:上下文多样性、长度多样性以及(在较小程度上)位置偏移。
引用
@article{arxiv.2105.01691,
title = {Data Augmentation by Concatenation for Low-Resource Translation: A Mystery and a Solution},
author = {Toan Q. Nguyen and Kenton Murray and David Chiang},
journal= {arXiv preprint arXiv:2105.01691},
year = {2021}
}
备注
Accepted at IWSLT 2021