结合词嵌入的卷积神经网络用于中文分词
计算与语言
2017-11-15 v1
摘要
基于字的序列标注框架对于中文分词(CWS)灵活且高效。近来,许多基于字的神经模型已应用于CWS。尽管它们取得了良好性能,但存在两个明显弱点。其一是严重依赖人工设计的大字特征,即不擅长自动捕获n-gram特征。其二是未利用完整词信息。针对第一弱点,我们提出一种卷积神经模型,无需任何特征工程即可捕获丰富的n-gram特征。针对第二弱点,我们提出一种将所提模型与词嵌入(word embeddings)有效整合的方法。我们在两个基准数据集PKU与MSR上评估该模型。无任何特征工程时,模型取得竞争性性能——PKU上95.7%,MSR上97.3%。借助词嵌入,模型在两个数据集上均达到最优(state-of-the-art)性能——PKU上96.5%,MSR上98.0%,且未使用任何外部标注资源。
引用
@article{arxiv.1711.04411,
title = {Convolutional Neural Network with Word Embeddings for Chinese Word Segmentation},
author = {Chunqi Wang and Bo Xu},
journal= {arXiv preprint arXiv:1711.04411},
year = {2017}
}
备注
will be published by IJCNLP2017