利用闭源多语言嵌入实现低资源语言句子自动对齐
计算与语言
2023-11-22 v1
摘要
定性平行数据在机器翻译中的重要性早已确定,但对于世界上大多数语言而言,始终难以获取足够数量的此类数据,主要原因在于相关成本以及这些语言的可及性不足。尽管利用自动方法从在线文章中获取平行数据集具有潜力,但取证调查发现了诸多质量相关问题,如错位对齐和错误的语言代码。在本工作中,我们提出了一个简单而高质量的平行句对齐器,其精心利用了闭源 Cohere 多语言嵌入——该方案在刚刚结束的 #CoHereAIHack 2023 挑战赛(见 https://ai6lagos.devpost.com)中排名第二。所提方法在 FLORES 和 MAFAND-MT 上分别取得了 和 的 f1 分数,而 LASER 分别为 和 。当将所得数据集与 MAFAND-MT 数据集结合用于训练翻译模型时,我们的方法相较 LASER 还实现了超过 5 个 BLEU 分数的提升。我们的代码与数据可在此处(https://github.com/abumafrim/Cohere-Align)获取以供研究使用。
引用
@article{arxiv.2311.12179,
title = {Leveraging Closed-Access Multilingual Embedding for Automatic Sentence Alignment in Low Resource Languages},
author = {Idris Abdulmumin and Auwal Abubakar Khalid and Shamsuddeen Hassan Muhammad and Ibrahim Said Ahmad and Lukman Jibril Aliyu and Babangida Sani and Bala Mairiga Abduljalil and Sani Ahmad Hassan},
journal= {arXiv preprint arXiv:2311.12179},
year = {2023}
}
备注
To appear in the proceedings of ICCAIT 2023. 6 pages, 2 figures