面向 Mixup 的自进化学习:增强少样本文本分类任务中的数据增强
计算与语言
2023-11-28 v3 网络与互联网体系结构
摘要
文本分类任务经常遇到标注数据有限的少样本场景,解决数据稀缺问题至关重要。使用 mixup 的数据增强已在多种文本分类任务上被证明是有效的。然而,大多数 mixup 方法未考虑训练不同阶段中学习难度的变化,并生成带有 one hot 标签的新样本,导致模型过度自信。本文中,我们提出一种基于自进化学习(SE)的 mixup 方法用于文本分类中的数据增强,该方法能为模型训练生成更具适应性和对模型更友好的伪样本。SE 关注模型学习能力的变异。为缓解模型置信度过高,我们引入一种新颖的实例特定标签平滑方法,该方法将模型的输出与原始样本的 one hot 标签进行线性插值,以生成用于标签混合的新软标签。通过实验分析,除提高分类准确率外,我们证明了 SE 还增强了模型的泛化能力。
引用
@article{arxiv.2305.13547,
title = {Self-Evolution Learning for Mixup: Enhance Data Augmentation on Few-Shot Text Classification Tasks},
author = {Haoqi Zheng and Qihuang Zhong and Liang Ding and Zhiliang Tian and Xin Niu and Dongsheng Li and Dacheng Tao},
journal= {arXiv preprint arXiv:2305.13547},
year = {2023}
}