中文

谨防源自由跨域少样本学习中的判别性陷阱

计算机视觉与模式识别 2026-03-17 v1 人工智能

摘要

源自由跨域少样本学习(SF-CDFSL)聚焦于使用来自目标域(如医学或卫星图像)的有限训练数据进行微调,其中视觉语言模型(VLM)如 CLIP 和 SigLIP 已显示出有前景的性能。当前在传统视觉模型中的工作表明,提高视觉判别性可提升性能。然而,在 VLM-based SF-CDFSL 任务中,我们发现\textbf{加强视觉-模态判别性实际上会抑制 VLM 的性能。本文旨在对此现象进行解释并提供解决方案。通过理论和实验证明,我们的研究揭示,在典型的交叉熵损失(Lvlm\mathcal{L}_{\mathrm{vlm}})微调中,包含视觉学习部分和跨模态学习部分,其中跨模态部分对于纠正 SF-CDFSL 中的严重模态错位至关重要。然而,我们发现视觉学习本质上是一个 shortcut,鼓励模型在不考虑跨模态部分的情况下减少 Lvlm\mathcal{L}_{\mathrm{vlm}},因此阻碍了跨模态对齐并损害了性能。基于此解释,我们进一步提出了解决方法:首先扰动视觉学习以引导模型关注跨模态对齐。然后使用视觉-文本语义关系在微调期间逐渐对视觉和文本模态进行对齐。广泛实验在各种设置、backbone(CLIP、SigLip、PE-Core)和任务(4 个 CDFSL 数据集和 11 个 FSL 数据集)上显示,我们一致地取得了新的 state-of-the-art 结果。代码地址:https://github.com/zhenyuZ-HUST/CVPR26-Mind-the-Discriminability-Trap。

关键词

引用

@article{arxiv.2603.13341,
  title  = {Mind the Discriminability Trap in Source-Free Cross-domain Few-shot Learning},
  author = {Zhenyu Zhang and Yixiong Zou and Yuhua Li and Ruixuan Li and Guangyao Chen},
  journal= {arXiv preprint arXiv:2603.13341},
  year   = {2026}
}

备注

CVPR 2026