基于新颖神经网络的低资源中文分词迁移深度学习
计算与语言
2017-09-15 v5
摘要
近期研究表明使用神经网络进行中文分词是有效的。然而,这些模型依赖大规模数据,且因训练数据不足而对低资源数据集效果较差。我们提出一种迁移学习方法,通过利用高资源语料库来改进低资源分词。首先,我们在高资源语料库上训练教师模型,然后利用学到的知识初始化学生模型。其次,提出一种加权数据相似性方法在低资源数据上训练学生模型。实验结果表明,我们的工作显著提升了低资源数据集上的性能:在PKU和CTB数据集上F值分别提升2.3%和1.5%。此外,本文取得了最先进的结果:在PKU和CTB数据集上F值分别为96.1%和96.2%。
引用
@article{arxiv.1702.04488,
title = {Transfer Deep Learning for Low-Resource Chinese Word Segmentation with a Novel Neural Network},
author = {Jingjing Xu and Xu Sun},
journal= {arXiv preprint arXiv:1702.04488},
year = {2017}
}