仅推理阶段的子字符分解改进未见语素文字字符的翻译
计算与语言
2020-11-13 v1
摘要
以语素文字为源语言的神经机器翻译(NMT)在翻译训练数据中从未出现过的“未见”字符时表现不佳。解决此问题的一种可能方法是对训练和测试句子使用子字符分解。然而,该方法涉及完全重训练,且其对向非语素文字语言翻译未见字符的有效性尚未被充分探索。我们针对汉英和日英 NMT,在高资源与低资源两种领域下,考察了现有的基于表意文字的子字符分解方法。对于每种语言对与领域,我们构建了一个测试集,其中所有源句子均包含至少一个未见语素文字字符。我们发现,完整的子字符分解常常损害未见字符翻译,且总体结果不一致。我们提出了一种简单的替代方案:仅在推理前对未见字符进行分解。我们的方法允许灵活应用,在无需额外模型或训练的情况下实现了翻译充分性的提升。
引用
@article{arxiv.2011.06523,
title = {Inference-only sub-character decomposition improves translation of unseen logographic characters},
author = {Danielle Saunders and Weston Feely and Bill Byrne},
journal= {arXiv preprint arXiv:2011.06523},
year = {2020}
}
备注
Workshop on Asian Translation (WAT) 2020