为摩揭陀语和布拉吉语开发通用依存树库
计算与语言
2022-04-28 v1
摘要
本文讨论了基于通用依存(Universal Dependencies)框架为两种低资源印度语言——摩揭陀语和布拉吉语——开发树库的工作。摩揭陀语树库包含 945 个句子,布拉吉语树库包含约 500 个句子,这些句子均标注了词元、词性、形态特征和通用依存关系。本文描述了这两种语言中发现的不同依存关系,并给出了两个树库的一些统计数据。该数据集将在下一次(v2.10)发布时在通用依存(UD)仓库(https://github.com/UniversalDependencies/UD_Magahi-MGTB/tree/master)上公开提供。
引用
@article{arxiv.2204.12633,
title = {Developing Universal Dependency Treebanks for Magahi and Braj},
author = {Mohit Raj and Shyam Ratan and Deepak Alok and Ritesh Kumar and Atul Kr. Ojha},
journal= {arXiv preprint arXiv:2204.12633},
year = {2022}
}
备注
11 pages, Workshop on Parsing and its Applications for Indian Languages (PAIL-2021) at ICON 2021