中文

梦摩纳加哈:全套古典梵文机器翻译数据集

计算与语言 2026-01-13 v1

摘要

虽然机器翻译被视为许多高资源语言的“已解决问题”,但仔细分析后很快会发现这并不成立。内容表现出诸如诗性语言、哲学概念、多层隐喻表达等挑战,梵文文学正是这类挑战的典型例子,因为它除了这些挑战外,还包含语言特征如缠络 (sandhi)、复合词和重度形态学,这些进一步复杂化了NLP下游任务。梵文文本跨越数千年的生产时间,涵盖多个领域,从仪式公式、史诗叙事、哲学论著、诗歌诗句到科学材料。目前,缺乏覆盖这些不同领域和时间层面的公开资源。因此,我们引入了梦摩纳加哈 (Mitrasamgraha),一个由391,548条平行文本对组成的高质量梵文至英语机器翻译数据集,规模是目前最大的梵文数据集 Itih=asa 的4倍以上。它覆盖了超过三个千年的时间范围和广泛的历史梵文领域。与网页爬取数据集不同,本数据集的时间和领域标注使我们能够对MT性能进行细粒度的领域和时间段影响分析。我们也发布了一个包含5,587条和5,552条后校对平行文本的验证集和测试集。我们对数据集上的商业模型和开源模型进行基准测试,并对 NLLB 和 Gemma 模型进行微调,显示出显著的改进,同时仍认识到在翻译复杂复合词、哲学概念和多层隐喻方面仍面临显著挑战。我们还分析了在该数据集上进行的情境学习对商业模型性能的影响。

关键词

引用

@article{arxiv.2601.07314,
  title  = {Mitrasamgraha: A Comprehensive Classical Sanskrit Machine Translation Dataset},
  author = {Sebastian Nehrdich and David Allport and Sven Sellmer and Jivnesh Sandhan and Manoj Balaji Jagadeeshan and Pawan Goyal and Sujeet Kumar and Kurt Keutzer},
  journal= {arXiv preprint arXiv:2601.07314},
  year   = {2026}
}