基于大规模多语言机器翻译模型的多枢纽集成研究
计算与语言
2024-04-30 v3 人工智能
机器学习
摘要
大规模多语言机器翻译模型允许使用单一模型翻译大量语言,但在低资源和极低资源翻译方向上性能有限。通过高资源语言进行枢纽翻译仍是低资源方向的一种强策略,本文中我们重新审视了通过多种语言进行枢纽翻译的方法。先前的工作使用了来自多条路径的概率分布的简单平均,但我们发现这比使用单一枢纽表现更差,并且加剧了幻觉问题,因为相同的幻觉在不同路径中可能都具有较高概率。我们还提出了MaxEns,一种新颖的组合策略,使输出偏向于最置信的预测,假设置信预测更不容易成为幻觉。我们在FLORES基准上针对20个低资源语言方向评估了不同策略,表明与直接翻译和平均方法相比,MaxEns在提升低资源语言翻译质量的同时减少了翻译中的幻觉。平均而言,多枢纽策略仍落后于使用英语作为单一枢纽语言,这引发了如何为给定翻译方向确定最佳枢纽策略的问题。
引用
@article{arxiv.2311.07439,
title = {Investigating Multi-Pivot Ensembling with Massively Multilingual Machine Translation Models},
author = {Alireza Mohammadshahi and Jannis Vamvas and Rico Sennrich},
journal= {arXiv preprint arXiv:2311.07439},
year = {2024}
}
备注
Accepted to Insights at NAACL 2024