中文

利用跨方言黄金句法处理低资源历史语言:面向通用的前现代斯拉夫语解析器

计算与语言 2020-11-13 v1

摘要

本文探讨了通过在不同相关变体的数据上训练专用解析器,从而提升前现代斯拉夫语专用解析器性能的可能性。由于其语言异质性,前现代斯拉夫语变体被视为低资源历史语言,借此可利用跨方言树库数据克服数据稀缺性,并尝试训练变体无关的解析器。本文讨论了早期斯拉夫语依存句法分析的前期实验,尤其关注其处理不同正字法、地域与文体特征的能力。使用 jPTDP(Nguyen & Verspoor 2018,一种用于联合词性(POS)标注与依存句法分析的神经网络模型,该模型在包括古教会斯拉夫语(OCS)在内的多个通用依存(UD)树库上展现出有前景的结果)训练了一个通用的前现代斯拉夫语解析器以及两个专用解析器——一个用于东斯拉夫语,一个用于南斯拉夫语。通过这些实验,我们在 OCS(83.79\% 无标记附着率(UAS)与 78.43\% 有标记附着率(LAS))和古东斯拉夫语(OES)(85.7\% UAS 与 80.16\% LAS)上均取得了新的最优结果。

关键词

引用

@article{arxiv.2011.06467,
  title  = {Exploiting Cross-Dialectal Gold Syntax for Low-Resource Historical Languages: Towards a Generic Parser for Pre-Modern Slavic},
  author = {Nilo Pedrazzini},
  journal= {arXiv preprint arXiv:2011.06467},
  year   = {2020}
}

备注

Edited by Folgert Karsdorp, Barbara McGillivray, Adina Nerghes & Melvin Wevers. Conference paper (Preprint version). 11 pages. A link to the repository with the datasets used in the paper can be found in the relevant footnotes