神经机器翻译低资源领域自适应的合适方案探寻
计算与语言
2022-06-03 v1 机器学习
摘要
通用翻译模型在专门领域往往仍难以生成准确译文。为引导机器翻译从业者并在不同数据可用性场景下刻画领域自适应方法的有效性,我们对预训练、第三方 NMT 模型在难以改动架构设置下的单语与平行数据领域自适应方法进行了深入的实证探索。我们比较了以孤立及组合方式使用的数据中心自适应方法。我们研究了方法在极低资源(8k 平行样例)与中等低资源(46k 平行样例)条件下的有效性,并提出了一种集成方法以缓解原始领域翻译质量的下降。我们的工作涵盖三个领域:消费电子、临床与生物医学,并跨越四组语言对——中英、日英、西英与俄英。我们还就实现高领域内性能提出了具体建议,并发布了所有语言的消费电子与医疗领域数据集,同时公开了我们的代码。
引用
@article{arxiv.2206.01137,
title = {Finding the Right Recipe for Low Resource Domain Adaptation in Neural Machine Translation},
author = {Virginia Adams and Sandeep Subramanian and Mike Chrzanowski and Oleksii Hrinchuk and Oleksii Kuchaiev},
journal= {arXiv preprint arXiv:2206.01137},
year = {2022}
}