利用合成目标数据助力机器翻译
计算与语言
2023-05-11 v1 人工智能
机器学习
摘要
在这项工作中,我们提供了一种在资源受限环境下训练机器翻译模型的方案,利用大型预训练模型生成的合成目标数据。我们表明,在双语、多语言和语音翻译设置的不同基准上,一致地,在合成目标上训练模型优于在真实标注数据上训练。随着可用资源(以数据集大小和模型参数量衡量)限制的加剧,这一性能差距变得更大。我们还初步分析了这种性能提升是否与优化便利性或更确定性的预测有关,以及这种范式是否能带来跨不同测试领域的更好分布外性能。
引用
@article{arxiv.2305.06155,
title = {Leveraging Synthetic Targets for Machine Translation},
author = {Sarthak Mittal and Oleksii Hrinchuk and Oleksii Kuchaiev},
journal= {arXiv preprint arXiv:2305.06155},
year = {2023}
}