通过分布估计提升少样本文本分类
计算与语言
2023-03-30 v1
摘要
分布估计已被证明是处理少样本图像分类最有效方法之一,因为底层模式和表征在计算机视觉领域可轻易跨任务迁移。然而,直接将该方法应用于少样本文本分类具有挑战性,因为利用具有充足样本的已知类的统计信息来校准新类的分布,可能因文本域中严重的类别差异而产生负面效应。为缓解此问题,我们提出两种简单而有效的策略,通过利用无标签查询样本来估计新类的分布,从而避免潜在的负迁移问题。具体而言,我们首先假设一个类或样本服从高斯分布,并使用原始支持集与最近的若干查询样本来估计相应的均值和协方差。然后,我们从估计的分布中采样以增广标注样本,从而为训练分类模型提供充分的监督。在八个少样本文本分类数据集上的大量实验表明,所提方法显著优于 state-of-the-art 基线。
引用
@article{arxiv.2303.16764,
title = {Boosting Few-Shot Text Classification via Distribution Estimation},
author = {Han Liu and Feng Zhang and Xiaotong Zhang and Siyang Zhao and Fenglong Ma and Xiao-Ming Wu and Hongyang Chen and Hong Yu and Xianchao Zhang},
journal= {arXiv preprint arXiv:2303.16764},
year = {2023}
}
备注
Accepted to AAAI 2023