使用 n-aksara 建模梵语及近梵语文本
计算与语言
2023-01-31 v1
摘要
尽管——或许正因为——其简单性,n元文法(即连续的词符序列)自20世纪末引入以来在计算语言学中取得了巨大成功。重述为k-mer(即连续的单体序列)后,它们也在计算生物学中找到了应用。当应用于文本分析时,n元文法通常采取词序列的形式。但如果我们试图将此模型应用于梵语文本分析,则面临艰巨任务:首先需解析sandhi以将短语切分为词,其次需将长复合词拆分为其组成成分。本文提出一种更简单的梵语文本n元文法分词方法,即使用n-aksara(即连续的aksara序列)。该模型减少了对sandhi解析的需求,使其在原始文本上更易于使用。该模型亦可用于近梵语文本,例如某梵语文本的泰米尔语注释。作为测试用例,Amarakosa 1.0.1的注释被建模为n-aksara,展示了跨越十个世纪与九种语言的文本复用模式。并就佛教注释实践作出了一些初步观察。
引用
@article{arxiv.2301.12969,
title = {Using n-aksaras to model Sanskrit and Sanskrit-adjacent texts},
author = {Charles Li},
journal= {arXiv preprint arXiv:2301.12969},
year = {2023}
}
备注
Perspectives of Digital Humanities in the Field of Buddhist Studies, Universit{\"a}t Hamburg; Numata Center for Buddhist Studies; Khyentse Center for Tibetan Buddhist Textual Scholarship, Jan 2023, Hamburg, Germany