基于视觉分布校准与跨模态分布对齐的小样本学习
计算机视觉与模式识别
2023-05-22 v1
摘要
预训练视觉-语言模型激发了大量小样本学习研究。然而,仅使用少量训练图像时存在两个关键问题:(1) 视觉特征分布易被图像中与类别无关的信息干扰;(2) 视觉与语言特征分布之间的对齐十分困难。针对干扰问题,我们提出选择性攻击(Selective Attack)模块,该模块由可训练适配器组成,生成图像的空间注意力图以引导对类别无关图像区域的攻击。通过扰乱这些区域,可捕获关键特征并校准图像特征的视觉分布。为更好地对齐描述同一对象类别的视觉与语言特征分布,我们提出跨模态分布对齐模块,其中为每一类引入视觉-语言原型以对齐分布,并采用推土机距离(Earth Mover's Distance, EMD)优化原型。为高效计算,推导了 EMD 的上界。此外,我们提出一种增强策略以增加图像与文本提示的多样性,从而减少对小样本训练图像的过拟合。在 11 个数据集上的大量实验表明,我们的方法在小样本学习中持续优于以往最优方法。实现代码将发布于 https://github.com/bhrqw/SADA。
引用
@article{arxiv.2305.11439,
title = {Few-Shot Learning with Visual Distribution Calibration and Cross-Modal Distribution Alignment},
author = {Runqi Wang and Hao Zheng and Xiaoyue Duan and Jianzhuang Liu and Yuning Lu and Tian Wang and Songcen Xu and Baochang Zhang},
journal= {arXiv preprint arXiv:2305.11439},
year = {2023}
}