中文

SAT:基于简单实例自适应自训练改进半监督文本分类

计算与语言 2022-10-25 v1 机器学习

摘要

自训练方法近年来被广泛探索,并在改进半监督学习方面展现出优异性能。本文提出一种用于半监督文本分类的简单实例自适应自训练方法(SAT)。SAT首先为每个无标签数据生成两个增强视图,然后训练一个元学习器,基于原始视图与增强视图之间的相似度自动识别增强的相对强度。将弱增强视图输入模型以产生伪标签,并利用强增强视图训练模型预测相同的伪标签。我们在三个文本分类数据集上进行了充分的实验与分析,发现随着有标签训练数据规模的变化,SAT相较于现有半监督学习方法始终表现出具有竞争力的性能。我们的代码可在 \url{https://github.com/declare-lab/SAT.git} 获取。

关键词

引用

@article{arxiv.2210.12653,
  title  = {SAT: Improving Semi-Supervised Text Classification with Simple Instance-Adaptive Self-Training},
  author = {Hui Chen and Wei Han and Soujanya Poria},
  journal= {arXiv preprint arXiv:2210.12653},
  year   = {2022}
}

备注

Accepted to EMNLP 2022 Findings