Sāmayik:一个英梵翻译的基准与数据集
计算与语言
2024-04-01 v2
摘要
我们发布Sāmayik,一个约53,000句平行英梵句子的数据集,以当代散文写成。梵语是一种仍存续的古典语言,拥有丰富的文献遗产。然而,由于数字化内容有限,它仍属低资源语言。现有梵语语料库,无论单语或双语,主要聚焦于诗歌,对当代书面材料的覆盖有限。Sāmayik从语言教学材料、文本教学法及在线教程等多种领域整理而来。它作为一项独特资源脱颖而出,专门服务于梵语的当代使用,以散文写作为主。在我们的数据集上训练的翻译模型在翻译域外当代语料时表现出统计显著的提升,优于在较旧古典时期诗歌数据集上训练的模型。最后,我们还通过适配四个多语言预训练模型发布基准模型,其中三个此前未接触过梵语以进行英梵互译,而其中一个是包含英梵的多语言预训练翻译模型。数据集与源代码见 https://github.com/ayushbits/saamayik。
引用
@article{arxiv.2305.14004,
title = {S\={a}mayik: A Benchmark and Dataset for English-Sanskrit Translation},
author = {Ayush Maheshwari and Ashim Gupta and Amrith Krishna and Atul Kumar Singh and Ganesh Ramakrishnan and G. Anil Kumar and Jitin Singla},
journal= {arXiv preprint arXiv:2305.14004},
year = {2024}
}
备注
LREC-COLING, 2024