中文

用于半监督文本分类的排序感知负训练

计算与语言 2023-06-14 v1

摘要

基于半监督文本分类的范式(SSTC)通常采用自训练的思想。其核心思想是在有限标注文本上训练深度分类器,然后迭代地将未标注文本预测为伪标签以用于进一步训练。然而,性能在很大程度上受伪标签准确率的影响,而这在真实场景中可能并不理想。本文提出一种排序感知负训练(RNT)框架,以带噪标签学习的方式解决SSTC问题。为缓解噪声信息,我们采用基于不确定性推理的方法,根据从未标注文本从标注文本所获得的证据支持对其进行排序。此外,我们提出利用负训练基于“输入实例不属于互补标签”的概念来训练RNT。互补标签是从除目标标签外的所有标签中随机选取的。直观上,真实标签作为互补标签的概率较低,因此在训练中提供较少噪声信息,从而在测试数据上取得更好性能。最后,我们在多个文本分类基准数据集上评估所提方案。大量实验表明,其在大多数场景下持续优于最先进的替代方法,并在其余场景中取得具竞争力的性能。RNT的代码公开于:https://github.com/amurtadha/RNT。

关键词

引用

@article{arxiv.2306.07621,
  title  = {Rank-Aware Negative Training for Semi-Supervised Text Classification},
  author = {Ahmed Murtadha and Shengfeng Pan and Wen Bo and Jianlin Su and Xinxin Cao and Wenze Zhang and Yunfeng Liu},
  journal= {arXiv preprint arXiv:2306.07621},
  year   = {2023}
}

备注

TACL 2023