少样本学习在机器翻译中出奇的有效性
计算与语言
2023-02-06 v1
摘要
我们展示了使用非配对语言数据训练的少样本翻译系统在高资源与低资源语言对上的潜力。我们表明,在推理时仅提供 5 个高质量翻译示例,一个仅通过自监督学习训练的 transformer 仅解码器模型,便能够匹敌专门的监督式最先进(state-of-the-art, SOTA)模型以及更通用的商业翻译系统。特别地,我们仅在使用 5 个英中平行数据示例进行推理的情况下,便在 WMT'21 英中新闻翻译任务上超越了表现最佳的系统。此外,我们构建这些模型的方法无需联合多语言训练或反向翻译,概念上简单,并展现出扩展到多语言设置的潜力。进而,所得模型的规模比最先进的语言模型小两个数量级。随后我们分析了影响少样本翻译系统性能的因素,并指出少样本演示的质量在很大程度上决定了我们模型所生成翻译的质量。最后,我们展示了少样本范式还提供了一种控制翻译某些属性的途径——我们表明仅使用 5 个推理示例便能控制地区变体与时态/正式程度,为可控机器翻译系统铺平了道路。
引用
@article{arxiv.2302.01398,
title = {The unreasonable effectiveness of few-shot learning for machine translation},
author = {Xavier Garcia and Yamini Bansal and Colin Cherry and George Foster and Maxim Krikun and Fangxiaoyu Feng and Melvin Johnson and Orhan Firat},
journal= {arXiv preprint arXiv:2302.01398},
year = {2023}
}