减少无意义词以联合进行中文分词与词性标注
计算与语言
2013-05-28 v1
摘要
传统的基于统计的中文分词与词性标注(S&T)联合方法具有识别训练数据中未出现新词的泛化能力,但其不良副作用是会产生大量无意义的词。我们提出了一种有效且高效的 S&T 框架,通过引入特征显著减少无意义词的生成。我们利用通用词典、Wikipedia 以及包含 2000 亿字符的大规模原始语料库来生成基于词性的词性特征。该基于词格(word-lattice)的框架包含一个基于字的模型和一个基于词的模型,以利用我们的基于词的特征。在 Penn Chinese Treebank 5 上的实验表明,与基线相比,该方法使无意义词的生成减少了 62.9%。结果,分词的 F1 值提高到了 0.984。
引用
@article{arxiv.1305.5918,
title = {Reduce Meaningless Words for Joint Chinese Word Segmentation and Part-of-speech Tagging},
author = {Kaixu Zhang and Maosong Sun},
journal= {arXiv preprint arXiv:1305.5918},
year = {2013}
}