面向非正式文本中名词短语分块的弱半马尔可夫条件随机场
计算与语言
2018-10-22 v1
摘要
本文基于一个已有的非正式文本语料库——NUS SMS Corpus (Chen and Kan, 2013)——构建了一个新的标注语料库。该新语料库包含来自 26,500 条短信的 76,490 个名词短语,由大学生标注。随后我们探索了若干图模型,包括一种用于名词短语分块任务的半马尔可夫条件随机场(semi-CRF)的新变体。我们在新数据集上的实证评估表明,与传统 semi-CRF 相比,该新变体取得了相近的准确率,但运行时间显著更短。
引用
@article{arxiv.1810.08567,
title = {Weak Semi-Markov CRFs for NP Chunking in Informal Text},
author = {Aldrian Obaja Muis and Wei Lu},
journal= {arXiv preprint arXiv:1810.08567},
year = {2018}
}
备注
5+1 pages, published in NAACL 2016