基于双重对比一致性的少样本文本分类
计算与语言
2022-10-03 v1 人工智能
机器学习
摘要
在本文中,我们探索如何利用预训练语言模型来执行少样本文本分类,其中每个类别仅给出少量标注样本。由于在此场景下使用传统交叉熵损失微调语言模型会导致严重的过拟合并致使模型泛化能力次优,我们采用有监督对比学习处理少量标注数据,并采用一致性正则化(consistency-regularization)处理大量无标注数据。此外,我们提出一种新颖的对比一致性以进一步提升模型性能并优化句子表示。在四个数据集上进行大量实验后,我们证明我们的模型(FTCC)能够优于当前最先进(SOTA)方法并具有更好的鲁棒性。
引用
@article{arxiv.2209.15069,
title = {Few-shot Text Classification with Dual Contrastive Consistency},
author = {Liwen Sun and Jiawei Han},
journal= {arXiv preprint arXiv:2209.15069},
year = {2022}
}
备注
8 pages, 2 figures, under review