Samas\=amayik:一组印地语-梵语机器翻译的平行数据集
计算与语言
2026-03-26 v1
摘要
我们发布Samasamayik,一组新精心挑选的大型印地语-梵语平行语料库,包含92,196个平行句子。与大多数集中在梵语古典时期文本和诗歌的语料不同,本语料库汇集了来自多种来源的数据,涵盖当代材料,包括 spoken tutorials、儿童杂志、广播对话及教学材料。我们通过对三个互补模型(ByT5、NLLB和IndicTrans-v2)进行微调来评估这一新数据集的实用性。我们的实验表明,在Samasamayik语料库上训练的模型在领域内测试数据上取得显著性能提升,而在其他广泛使用的测试集上则实现可比的性能,为当代印地语-梵语翻译建立了强大的新基准。此外,与现有语料库的比较分析显示,本数据集在语义和词汇层面与现有资源几乎没有重叠,确认了其新颖性和非冗余性,作为低资源印度语言机器翻译的稳健新资源。
引用
@article{arxiv.2603.24307,
title = {Samas\=amayik: A Parallel Dataset for Hindi-Sanskrit Machine Translation},
author = {N J Karthika and Keerthana Suryanarayanan and Jahanvi Purohit and Ganesh Ramakrishnan and Jitin Singla and Anil Kumar Gourishetty},
journal= {arXiv preprint arXiv:2603.24307},
year = {2026}
}