中文

为摩揭陀语和布拉吉语开发通用依存树库

计算与语言 2022-04-28 v1

摘要

本文讨论了基于通用依存(Universal Dependencies)框架为两种低资源印度语言——摩揭陀语和布拉吉语——开发树库的工作。摩揭陀语树库包含 945 个句子,布拉吉语树库包含约 500 个句子,这些句子均标注了词元、词性、形态特征和通用依存关系。本文描述了这两种语言中发现的不同依存关系,并给出了两个树库的一些统计数据。该数据集将在下一次(v2.10)发布时在通用依存(UD)仓库(https://github.com/UniversalDependencies/UD_Magahi-MGTB/tree/master)上公开提供。

关键词

引用

@article{arxiv.2204.12633,
  title  = {Developing Universal Dependency Treebanks for Magahi and Braj},
  author = {Mohit Raj and Shyam Ratan and Deepak Alok and Ritesh Kumar and Atul Kr. Ojha},
  journal= {arXiv preprint arXiv:2204.12633},
  year   = {2022}
}

备注

11 pages, Workshop on Parsing and its Applications for Indian Languages (PAIL-2021) at ICON 2021