CorIL:丰富印度语言平行语料库与机器翻译系统
计算与语言
2025-09-25 v1 人工智能
摘要
印度的语言景观是世界上最为多样化的,包含超过 120 种主要语言和约 1,600 种附加语言,其中 22 种在印度宪法中被正式认可为官方语言。尽管近期在多语言神经机器翻译 (NMT) 方面取得了进展,但针对印度语言的高质量平行语料仍然稀缺,尤其是在不同领域。本文引入了一个大规模高质量标注的平行语料库,覆盖这些语言中的 11 种:English、Telugu、Hindi、Punjabi、Odia、Kashmiri、Sindhi、Dogri、Kannada、Urdu 和 Gujarati,总计 772,000 对双语句子。该数据集经过精心挑选并系统分类为三个关键领域:Government、Health 和 General,以便于进行领域感知的机器翻译研究并促进有效的领域适应。为演示 CorIL 的实用性并为未来研究建立强有力的基准,我们微调和评估了多个最新 NMT 模型,包括 IndicTrans2、NLLB 和 BhashaVerse。我们的分析揭示了重要的性能趋势,并凸显了该语料库在探索模型能力方面的价值。例如,结果显示基于语言脚本的性能呈现不同的模式, massively 多语言模型在波斯-阿拉伯脚本 (Urdu、Sindhi) 上表现优势,而其他模型在印度脚本上更为出色。本文提供了详细的领域性能分析,为领域灵敏性和跨脚本迁移学习提供了见解。通过公开发布 CorIL,我们旨显著提高印度语言高质量训练数据的可得性,并为机器翻译研究社区提供一个宝贵资源。
引用
@article{arxiv.2509.19941,
title = {CorIL: Towards Enriching Indian Language to Indian Language Parallel Corpora and Machine Translation Systems},
author = {Soham Bhattacharjee and Mukund K Roy and Yathish Poojary and Bhargav Dave and Mihir Raj and Vandan Mujadia and Baban Gain and Pruthwik Mishra and Arafat Ahsan and Parameswari Krishnamurthy and Ashwath Rao and Gurpreet Singh Josan and Preeti Dubey and Aadil Amin Kak and Anna Rao Kulkarni and Narendra VG and Sunita Arora and Rakesh Balbantray and Prasenjit Majumdar and Karunesh K Arora and Asif Ekbal and Dipti Mishra Sharma},
journal= {arXiv preprint arXiv:2509.19941},
year = {2025}
}