去粗取精:利用数据过滤提升低资源非洲语言的多语机器翻译
计算与语言
2022-10-21 v2
摘要
我们参与了 WMT 2022 非洲语言共享任务的大规模机器翻译评测。本工作描述了我们的方法,该方法基于通过使用句子对分类器过滤给定的含噪数据,该分类器通过对预训练语言模型进行微调而构建。为训练该分类器,我们从黄金标准精选数据集中获取正样本(即高质量平行句对),并从自动对齐的平行数据中提取负样本(即低质量平行句对),具体通过选取对齐分数较低的句子实现。我们最终的机器翻译模型随后在过滤后的数据上训练,而非整个含噪数据集。我们通过在两个常用数据集上评测来实证验证我们的方法,并表明数据过滤通常能提升整体翻译质量,在某些情况下甚至显著提升。
引用
@article{arxiv.2210.10692,
title = {Separating Grains from the Chaff: Using Data Filtering to Improve Multilingual Translation for Low-Resourced African Languages},
author = {Idris Abdulmumin and Michael Beukman and Jesujoba O. Alabi and Chris Emezue and Everlyn Asiko and Tosin Adewumi and Shamsuddeen Hassan Muhammad and Mofetoluwa Adeyemi and Oreen Yousuf and Sahib Singh and Tajuddeen Rabiu Gwadabe},
journal= {arXiv preprint arXiv:2210.10692},
year = {2022}
}
备注
Accepted at the Seventh Conference on Machine Translation (WMT22)