通过两阶段跨度标注的联合中文分词与词性标注
计算与语言
2021-12-20 v1
摘要
中文分词与词性标注在计算语言学和自然语言处理应用中是必要的任务。许多研究者仍在深度学习时代对中文分词与词性标注的需求存在争议。然而,消解歧义与检测未知词是该领域的挑战性问题。以往关于联合中文分词与词性标注的研究主要遵循基于字的标注模型,侧重于建模n-gram特征。与以往工作不同,我们提出一个名为SpanSegTag的神经模型,遵循跨度标注进行联合中文分词与词性标注,其中每个n-gram作为词及其词性标签的概率是核心问题。我们对连续字符的左右边界表示使用双仿射(biaffine)操作来建模n-gram。我们的实验表明,基于BERT的模型SpanSegTag在CTB5、CTB6和UD基准数据集上取得了与当前最优方法(使用BERT或ZEN编码器)相竞争的性能,或在CTB7和CTB9基准数据集上相比取得了显著改进。
引用
@article{arxiv.2112.09488,
title = {Joint Chinese Word Segmentation and Part-of-speech Tagging via Two-stage Span Labeling},
author = {Duc-Vu Nguyen and Linh-Bao Vo and Ngoc-Linh Tran and Kiet Van Nguyen and Ngan Luu-Thuy Nguyen},
journal= {arXiv preprint arXiv:2112.09488},
year = {2021}
}
备注
In Proceedings of the 35th Pacific Asia Conference on Language, Information and Computation (PACLIC 2021)