基于视觉语言模型的跨域少样本学习:多视角协同优化
计算机视觉与模式识别
2025-08-19 v1
摘要
视觉语言模型(VLMs)如CLIP等预训练于自然图像和语言数据,已在少样本图像识别任务中展现出巨大的潜力,推动了多种高效迁移学习方法的发展。这些方法利用VLMs中内在的预学习知识,已在标准图像数据集上取得显著性能。然而,这些方法在面对跨域任务时常受限,尤其是当图像域与自然图像不同时。为此,我们提出一种一致性引导的多视角协同优化策略(CoMuCo),作为VLMs的一种新型微调方法。该策略采用两个功能互补的专家模块提取多视觉特征,同时融合基于先验知识的一致性约束和基于信息几何的共识机制,以增强特征学习的鲁棒性。此外,本文构建了一个新的跨域少样本基准,旨在全面评估在自然图像之外的 imaging 域上的方法。大量实验表明,CoMuCo在少样本任务中始终优于当前方法。该代码和基准将予以公开。
引用
@article{arxiv.2508.12861,
title = {Cross-Domain Few-Shot Learning via Multi-View Collaborative Optimization with Vision-Language Models},
author = {Dexia Chen and Wentao Zhang and Qianjie Zhu and Ping Hu and Weibing Li and Tong Zhang and Ruixuan Wang},
journal= {arXiv preprint arXiv:2508.12861},
year = {2025}
}