用于半监督文本分类的排序感知负训练
计算与语言
2023-06-14 v1
摘要
基于半监督文本分类的范式(SSTC)通常采用自训练的思想。其核心思想是在有限标注文本上训练深度分类器,然后迭代地将未标注文本预测为伪标签以用于进一步训练。然而,性能在很大程度上受伪标签准确率的影响,而这在真实场景中可能并不理想。本文提出一种排序感知负训练(RNT)框架,以带噪标签学习的方式解决SSTC问题。为缓解噪声信息,我们采用基于不确定性推理的方法,根据从未标注文本从标注文本所获得的证据支持对其进行排序。此外,我们提出利用负训练基于“输入实例不属于互补标签”的概念来训练RNT。互补标签是从除目标标签外的所有标签中随机选取的。直观上,真实标签作为互补标签的概率较低,因此在训练中提供较少噪声信息,从而在测试数据上取得更好性能。最后,我们在多个文本分类基准数据集上评估所提方案。大量实验表明,其在大多数场景下持续优于最先进的替代方法,并在其余场景中取得具竞争力的性能。RNT的代码公开于:https://github.com/amurtadha/RNT。
引用
@article{arxiv.2306.07621,
title = {Rank-Aware Negative Training for Semi-Supervised Text Classification},
author = {Ahmed Murtadha and Shengfeng Pan and Wen Bo and Jianlin Su and Xinxin Cao and Wenze Zhang and Yunfeng Liu},
journal= {arXiv preprint arXiv:2306.07621},
year = {2023}
}
备注
TACL 2023