中文

面向梵语词汇、句法与语义任务的语言学驱动神经架构

计算与语言 2023-08-21 v1

摘要

本论文的主要目标是通过自然语言技术使梵语手稿更易于终端用户使用。梵语的形态丰富性、复合词、自由词序以及低资源特性,为开发深度学习方案带来了显著挑战。我们确定了四项对构建鲁棒梵语NLP技术至关重要的基础任务:分词、依存句法分析、复合词类型识别和诗歌分析。第一项任务,梵语分词(SWS),是任何其他下游应用的基础文本处理任务。然而,由于修改词边界字符的连声(sandhi)现象,该任务具有挑战性。类似地,现有依存句法分析方法难以应对梵语这类形态丰富且低资源的语言。由于成分间语义关系受上下文敏感,复合词类型识别对梵语同样困难。这些挑战导致问答和机器翻译等NLP应用性能欠佳。最后,梵语诗歌在计算语言学中也未得到广泛研究。在应对这些挑战时,本论文作出了多方面贡献:(1) 提出面向这些任务的语言学驱动神经架构。(2) 展示了所提系统的可解释性与多语言扩展能力。(3) 所提系统取得了最先进(state-of-the-art)性能。(4) 最后,我们呈现了一个名为SanskritShala的神经工具包,这是一个基于网页的应用,可对输入进行多种NLP任务的实时分析。总体而言,本论文通过开发鲁棒NLP技术并发布多种资源、数据集和基于网页的工具包,为梵语手稿的可及性作出了贡献。

关键词

引用

@article{arxiv.2308.08807,
  title  = {Linguistically-Informed Neural Architectures for Lexical, Syntactic and Semantic Tasks in Sanskrit},
  author = {Jivnesh Sandhan},
  journal= {arXiv preprint arXiv:2308.08807},
  year   = {2023}
}

备注

Ph.D. dissertation