中文

神经网络对抗(并促进)自训练:小标注集与大未标注集下的分类

计算与语言 2024-01-02 v1

摘要

我们提出了一种基于自训练的半监督文本分类器,利用了神经网络的一个正面特性和一个负面特性。自训练的弱点之一是语义漂移问题,即噪声伪标签在迭代过程中累积,导致错误率飙升。为了解决这一挑战,我们重塑了伪标签的角色,并创建了信息的层次顺序。此外,自训练中的一个关键步骤是利用分类器的置信度预测来选择最佳的候选伪标签。由于神经网络的输出校准不良,这一步无法有效完成。为了克服这一挑战,我们提出了一种混合度量来替代简单的置信度测量,该度量通过子采样技术考虑了预测不确定性。我们在五个标准基准上评估了我们的模型,结果表明它显著优于十个不同的基线模型。此外,我们证明我们的模型所实现的改进与语言模型预训练(一种广泛使用的利用未标注文档的技术)是加性的。我们的代码可在https://github.com/p-karisani/RST获取。

关键词

引用

@article{arxiv.2401.00575,
  title  = {Neural Networks Against (and For) Self-Training: Classification with Small Labeled and Large Unlabeled Sets},
  author = {Payam Karisani},
  journal= {arXiv preprint arXiv:2401.00575},
  year   = {2024}
}

备注

ACL Findings 2023