中文

Hint-Aug:从基础视觉 Transformer 中提取提示以提升少样本参数高效微调

计算机视觉与模式识别 2023-06-27 v3 人工智能

摘要

尽管在下游任务上微调基础视觉 Transformer(FViT)的需求日益增长,但由于 FViT 本身对数据的高需求特性,在数据有限场景(如少样本微调)下充分释放其潜力仍具挑战。常见的数据增强技术在此情境下表现不佳,因为少样本微调数据中包含的特征有限。为应对这一挑战,我们首先明确了 FViT 在少样本微调中的一个机会:预训练 FViT 已从大规模预训练数据中学习到极具代表性的特征,这些特征在广泛使用的参数高效微调中被完整保留。因此我们假设,利用这些已学特征来增强微调数据可提升少样本 FViT 微调的效果。为此,我们提出一种称为基于提示的数据增强(Hint-Aug)的框架,旨在通过用预训练 FViT 的已学特征增强微调样本中过拟合的部分来提升 FViT 的少样本微调表现。具体而言,Hint-Aug 集成了两个关键组件:(1)一个注意力过拟合检测器(AOD),用于检测基础 ViT 中过自信的图像块,以潜在缓解其对少样本微调数据的过拟合;(2)一个基于混淆的特征注入(CFI)模块,将预训练 FViT 中易混淆的特征与上述 AOD 检测到的过自信图像块相融合,从而在微调期间增强特征多样性。在五个数据集和三种参数高效微调技术上的大量实验与消融研究一致验证了 Hint-Aug 的有效性:在各种少样本设定下,准确率比最先进的(SOTA)数据增强方法高出 0.04% 至 32.91%。例如,在 Pet 数据集上,Hint-Aug 以少 50% 的训练数据取得了比 SOTA 数据增强方法高 2.22% 的准确率。

关键词

引用

@article{arxiv.2304.12520,
  title  = {Hint-Aug: Drawing Hints from Foundation Vision Transformers Towards Boosted Few-Shot Parameter-Efficient Tuning},
  author = {Zhongzhi Yu and Shang Wu and Yonggan Fu and Shunyao Zhang and Yingyan Lin},
  journal= {arXiv preprint arXiv:2304.12520},
  year   = {2023}
}