Samanantar:面向 11 种印度语言的最大公开平行语料库集合
计算与语言
2023-06-14 v4
摘要
我们推出 Samanantar,面向印度语言的最大公开平行语料库集合。该集合包含英语与 11 种印度语言(来自两个语系)之间共计 4970 万句对。具体而言,我们汇编了来自现有公开平行语料的 1240 万句对,并额外从网络挖掘了 3740 万句对,实现了 4 倍的增量。我们通过结合多个语料库、工具与方法来从网络挖掘平行句对:(a) 网络爬取的单语语料库,(b) 用于从扫描文档提取句子的文档 OCR,(c) 用于对齐句子的多语言表示模型,以及 (d) 用于在大句子集合中检索的近似最近邻搜索。对新挖掘语料样本的人工评估验证了跨 11 种语言平行句子的高质量。此外,我们以英语为枢纽语言,从以英语为中心的平行语料中提取了所有 55 个印度语言对之间的 8340 万句对。我们在 Samanantar 上训练了涵盖所有这些语言的多语言 NMT 模型,其在 FLORES 等公开基准上优于现有模型与基线,确立了 Samanantar 的效用。我们的数据与模型公开于 https://ai4bharat.iitm.ac.in/samanantar,希望它们能推动印度语言的 NMT 与多语言 NLP 研究。
引用
@article{arxiv.2104.05596,
title = {Samanantar: The Largest Publicly Available Parallel Corpora Collection for 11 Indic Languages},
author = {Gowtham Ramesh and Sumanth Doddapaneni and Aravinth Bheemaraj and Mayank Jobanputra and Raghavan AK and Ajitesh Sharma and Sujit Sahoo and Harshita Diddee and Mahalakshmi J and Divyanshu Kakwani and Navneet Kumar and Aswin Pradeep and Srihari Nagaraj and Kumar Deepak and Vivek Raghavan and Anoop Kunchukuttan and Pratyush Kumar and Mitesh Shantadevi Khapra},
journal= {arXiv preprint arXiv:2104.05596},
year = {2023}
}
备注
Accepted to the Transactions of the Association for Computational Linguistics (TACL)