梵语派生名词分析的基准语料库与神经方法
计算与语言
2024-09-05 v1
摘要
本文提出了首个梵语 Pratyaya(后缀)及由后缀形成的屈折词(padas)的基准语料库,以及基于神经网络的方法来处理屈折词的形成与拆分。屈折词涵盖了 primary 与 secondary 派生名词,作为当前工作的范围。Pratyaya 是梵语文本形态分析的一个重要维度。已有一些梵语计算语言学工具用于处理和解析梵语文本。遗憾的是,尚无任何工作专门对这些工具在派生名词分析方面进行标准化与验证。在本工作中,我们构建了名为 Pratyaya-Kosh 的梵语后缀基准语料库以评估工具性能。我们还提出了自己的派生名词神经分析方法,并在最知名的梵语形态分析工具上进行了评估。该基准将免费奉献并供全球研究者使用,希望它能激励各方改进梵语的形态分析。
引用
@article{arxiv.2010.12937,
title = {A Benchmark Corpus and Neural Approach for Sanskrit Derivative Nouns Analysis},
author = {Arun Kumar Singh and Sushant Dave and Prathosh A. P. and Brejesh Lall and Shresth Mehta},
journal= {arXiv preprint arXiv:2010.12937},
year = {2024}
}
备注
6 pages, 2 figures, EACL 2021 Submission