中文

面向低资源神经序列标注的不确定性感知自训练

计算与语言 2023-02-20 v1

摘要

神经序列标注(NSL)旨在为输入语言词元分配标签,涵盖命名实体识别(NER)与槽填充等广泛应用。然而,传统基于监督的方法所取得的满意结果严重依赖于大量人工标注数据,受数据隐私与计算效率问题影响,这在真实场景中往往不可行。本文提出 SeqUST,一种用于 NSL 的新颖不确定性感知自训练框架,以解决标注数据稀缺问题并有效利用无标注数据。具体而言,我们在贝叶斯神经网络(BNN)中引入蒙特卡洛(MC) dropout 进行词元级不确定性估计,并基于模型置信度与确定性从无标注数据中筛选可靠语言词元。一个精心设计的带噪声鲁棒损失的掩码序列标注任务支持鲁棒训练,旨在抑制噪声伪标签问题。此外,我们开发了一种基于高斯的一致性正则化技术,以进一步提升模型在高斯分布扰动表示上的鲁棒性。这有效缓解了源于伪标签增强数据的过拟合困境。在六个基准上的大量实验表明,我们的 SeqUST 框架有效提升了自训练性能,并在低资源场景下以较大优势持续优于强基线。

关键词

引用

@article{arxiv.2302.08659,
  title  = {Uncertainty-aware Self-training for Low-resource Neural Sequence Labeling},
  author = {Jianing Wang and Chengyu Wang and Jun Huang and Ming Gao and Aoying Zhou},
  journal= {arXiv preprint arXiv:2302.08659},
  year   = {2023}
}

备注

11 pages, 3 figures