中文

基于新颖神经网络的低资源中文分词迁移深度学习

计算与语言 2017-09-15 v5

摘要

近期研究表明使用神经网络进行中文分词是有效的。然而,这些模型依赖大规模数据,且因训练数据不足而对低资源数据集效果较差。我们提出一种迁移学习方法,通过利用高资源语料库来改进低资源分词。首先,我们在高资源语料库上训练教师模型,然后利用学到的知识初始化学生模型。其次,提出一种加权数据相似性方法在低资源数据上训练学生模型。实验结果表明,我们的工作显著提升了低资源数据集上的性能:在PKU和CTB数据集上F值分别提升2.3%和1.5%。此外,本文取得了最先进的结果:在PKU和CTB数据集上F值分别为96.1%和96.2%。

关键词

引用

@article{arxiv.1702.04488,
  title  = {Transfer Deep Learning for Low-Resource Chinese Word Segmentation with a Novel Neural Network},
  author = {Jingjing Xu and Xu Sun},
  journal= {arXiv preprint arXiv:1702.04488},
  year   = {2017}
}