基于因果解耦与跨模态对齐的增强型少样本学习
计算机视觉与模式识别
2025-08-06 v1
摘要
少样本学习(Few-shot Learning, FSL)通常需要有效地利用有限的标注数据进行模型适应。然而,大多数现有FSL方法依赖于耦合的表征,要求模型仅凭有限的监督信息隐式恢复解耦过程以获得解耦表征,这会阻碍有效的适应。近期的理论研究表明,诸如CLIP等多模态对比学习方法可将潜在表征解耦至线性变换。基于此,我们提出了因果CLIP适配器(Causal CLIP Adapter, CCA),一种新型框架,通过无监督独立成分分析(Independent Component Analysis, ICA)显式解耦从CLIP提取的视觉特征。这一做法无需从标注数据中学习解耦过程,从而减少可训练参数数量并缓解过拟合问题。进一步地,虽然ICA可获得视觉解耦表征,但可能会干扰CLIP的内在模态间对齐。为此,CCA进一步利用CLIP固有的跨模态对齐方式,分别通过基于CLIP的文本分类器微调以及跨注意力机制实现单向和双向增强,丰富视觉与文本表征的相互互动。无论是单模态还是跨模态的分类输出,都可通过线性方式有效组合,从而提升分类准确率。实验在11个基准数据集上进行,结果表明该方法在少样本性能和分布迁移鲁棒性方面 consistently优于最新方法,同时保持计算效率。代码将在https://github.com/tianjiao-j/CCA上提供。
引用
@article{arxiv.2508.03102,
title = {Causal Disentanglement and Cross-Modal Alignment for Enhanced Few-Shot Learning},
author = {Tianjiao Jiang and Zhen Zhang and Yuhang Liu and Javen Qinfeng Shi},
journal= {arXiv preprint arXiv:2508.03102},
year = {2025}
}