面向基于多准则学习的快速准确神经中文分词
计算与语言
2020-10-12 v2
摘要
歧义性的标注准则导致了不同粒度中文分词(CWS)数据集的分歧。多准则中文分词旨在捕捉各数据集间多样的标注准则并利用其潜在的共性知识。本文中,我们提出一种域自适应分词器以利用不同数据集的多样准则。我们的模型基于来自 Transformer 的双向编码器表示(BERT),其负责引入开放域知识。我们提出私有与共享投影层,分别用于捕捉特定域知识与共性知识。我们还通过蒸馏、量化和编译器优化来提升计算效率。实验表明,我们的分词器在 10 个 CWS 数据集上以更优的效率超越了先前的最先进(SOTA)模型。
引用
@article{arxiv.1903.04190,
title = {Toward Fast and Accurate Neural Chinese Word Segmentation with Multi-Criteria Learning},
author = {Weipeng Huang and Xingyi Cheng and Kunlong Chen and Taifeng Wang and Wei Chu},
journal= {arXiv preprint arXiv:1903.04190},
year = {2020}
}
备注
Accepted at COLING 2020