中文

面向中文分词的多重字符嵌入方法

计算与语言 2019-05-31 v3

摘要

中文分词(CWS)在当前大多数工作中常被视为基于字符的序列标注任务,这些工作在强大神经网络的帮助下取得了巨大成功。然而,这些工作忽略了一个重要线索:汉字兼具语义和语音含义。本文引入包括拼音罗马化和五笔输入在内的多重字符嵌入,二者均易于获取且能有效刻画字符语义。我们提出一种新颖的共享Bi-LSTM-CRF模型,通过在训练过程中共享LSTM网络来高效融合语言特征。在五个语料库上的大量实验表明,额外嵌入有助于在标注准确率上获得显著提升。具体而言,我们在不使用任何外部词汇资源的情况下,于AS和CityU语料库上分别以96.9和97.3的F1分数取得了最先进的性能。

关键词

引用

@article{arxiv.1808.04963,
  title  = {Multiple Character Embeddings for Chinese Word Segmentation},
  author = {Jingkang Wang and Jianing Zhou and Jie Zhou and Gongshen Liu},
  journal= {arXiv preprint arXiv:1808.04963},
  year   = {2019}
}

备注

To appear in ACL-SRW 2019