中文

Itihasa:一个用于梵英翻译的大规模语料库

计算与语言 2021-10-07 v3

摘要

本工作介绍了 Itihasa,一个包含 93,000 对梵语 shloka 及其英译的大规模翻译数据集。这些 shloka 提取自两部印度史诗,即《罗摩衍那》与《摩诃婆罗多》。我们首先描述策划此类数据集的动机,随后通过实证分析揭示其细微特征。接着,我们在此语料库上对标标准翻译模型的性能,结果表明即便最先进的 transformer 架构也表现不佳,凸显了该数据集的复杂性。

关键词

引用

@article{arxiv.2106.03269,
  title  = {Itihasa: A large-scale corpus for Sanskrit to English translation},
  author = {Rahul Aralikatte and Miryam de Lhoneux and Anoop Kunchukuttan and Anders Søgaard},
  journal= {arXiv preprint arXiv:2106.03269},
  year   = {2021}
}

备注

Fixed typo