中文

面向低资源语言的基于实指的的无监督通用词性标注器

计算与语言 2019-04-12 v1 人工智能 机器学习

摘要

无监督词性(POS)标注常被框定为聚类问题,但实用的标注器还需要将其聚类“实指”(ground)出来。实指一般需要参考标注数据,而低资源语言可能不具备这一条件。本工作中,我们描述一种用于低资源无监督POS标注的方法,其产生完全实指的输出且不需要标注训练数据。我们发现Brown等人(1992)的经典方法在我们的用例中聚类良好,并采用基于破译的实指方法。该方法假定聚类ID序列为“密文”,并寻求一个POS标签到聚类ID的映射以揭示POS序列。我们从内在表明,尽管任务困难,我们在多种语言上获得了合理性能。我们还从外在表明,将我们的POS标注器纳入命名标注器可在僧伽罗语和卢旺达语(两种几乎无可用标注POS数据的语言)中达到最先进的标注性能。我们进一步通过将标注器纳入Malopa(Ammar等人,2016)依赖解析器模型的真正“零资源”变体来展示其效用,该变体去除了当前对新语言的多语言资源和黄金POS标签依赖。实验显示,包含我们的标注器弥补了无黄金POS标签时损失的大部分准确率。

关键词

引用

@article{arxiv.1904.05426,
  title  = {A Grounded Unsupervised Universal Part-of-Speech Tagger for Low-Resource Languages},
  author = {Ronald Cardenas and Ying Lin and Heng Ji and Jonathan May},
  journal= {arXiv preprint arXiv:1904.05426},
  year   = {2019}
}

备注

NAACL-HLT 2019, 12 pages, code available at https://github.com/isi-nlp/universal-cipher-pos-tagging