中文

面向非正式文本中名词短语分块的弱半马尔可夫条件随机场

计算与语言 2018-10-22 v1

摘要

本文基于一个已有的非正式文本语料库——NUS SMS Corpus (Chen and Kan, 2013)——构建了一个新的标注语料库。该新语料库包含来自 26,500 条短信的 76,490 个名词短语,由大学生标注。随后我们探索了若干图模型,包括一种用于名词短语分块任务的半马尔可夫条件随机场(semi-CRF)的新变体。我们在新数据集上的实证评估表明,与传统 semi-CRF 相比,该新变体取得了相近的准确率,但运行时间显著更短。

关键词

引用

@article{arxiv.1810.08567,
  title  = {Weak Semi-Markov CRFs for NP Chunking in Informal Text},
  author = {Aldrian Obaja Muis and Wei Lu},
  journal= {arXiv preprint arXiv:1810.08567},
  year   = {2018}
}

备注

5+1 pages, published in NAACL 2016