用于文本分类的简单抽样与硬混合策略结合原型以重平衡对比学习
计算与语言
2026-01-26 v2
摘要
文本分类是 web 内容挖掘中的关键且基础任务。与通过交叉熵损失的预训练微调范式相比,最近提出的监督对比学习方法因其强大的特征学习能力和鲁棒性而受到广泛关注。尽管已有研究将此技术用于文本分类,但仍存在一些局限性。首先,许多文本数据集不平衡,监督对比学习的学习机制对数据不平衡敏感,可能损害模型性能。其次,这些模型利用独立的分类分支和监督对比学习分支,但缺乏显式的相互指导。为此,我们提出了一种名为 SharpReCL 的新模型,用于不平衡文本分类任务。首先,我们获取每个类别在平衡分类分支中的原型向量,以作为每个类别的表示。然后,通过进一步显式地利用原型向量,我们为每个类别构建一组大小相同的目标样本集,以执行监督对比学习程序。实验结果表明,我们的模型有效,即使在多个数据集上也优于流行的大型语言模型。我们的代码已公开。
引用
@article{arxiv.2405.11524,
title = {Simple-Sampling and Hard-Mixup with Prototypes to Rebalance Contrastive Learning for Text Classification},
author = {Mengyu Li and Yonghao Liu and Fausto Giunchiglia and Ximing Li and Xiaoyue Feng and Renchu Guan},
journal= {arXiv preprint arXiv:2405.11524},
year = {2026}
}
备注
WWW26