利用合成码码混合探索英语到Hinglish的Text-to-Text Transformer机器翻译
计算与语言
2021-05-20 v1
摘要
我们描述了聚焦于将单语与码码混合语言对互译这一研究不足问题的模型。更具体地,我们提供了一系列将单语英语文本转换为Hinglish(印地语与英语的码码混合)的模型。鉴于预训练语言模型近期的成功,我们还测试了两个近期基于Transformer的编码器-解码器模型(即mT5和mBART)在该任务上的效用,发现二者均表现良好。鉴于码码混合训练数据的匮乏,我们还提出了一种无依赖的方法,从双语分布式表示生成码码混合文本,并用以提升语言模型性能。特别地,借助这些额外数据,我们采用课程学习策略,先在数学合成数据上微调语言模型,再在黄金码码混合数据上微调。我们发现,尽管简单,我们的合成码码混合方法在多种条件下可与若干标准方法(回译、基于等价约束理论的方法)竞争(且在某些情况下甚至更优)。我们的工作表明,遵循课程学习流程微调的mT5模型取得了最佳翻译性能(12.67 BLEU)。我们的模型在英语-Hinglish官方共享任务的总排名中位居第一。
引用
@article{arxiv.2105.08807,
title = {Exploring Text-to-Text Transformers for English to Hinglish Machine Translation with Synthetic Code-Mixing},
author = {Ganesh Jawahar and El Moatez Billah Nagoudi and Muhammad Abdul-Mageed and Laks V. S. Lakshmanan},
journal= {arXiv preprint arXiv:2105.08807},
year = {2021}
}
备注
Computational Approaches to Linguistic Code-Switching (CALCS 2021) workshop