适配多模态基础模型用于少样本学习:关于对比字幕器的综合研究
计算机视觉与模式识别
2025-12-16 v1 人工智能
摘要
大规模多模态基础模型,特别是对比字幕器(CoCa),通过统一对比对齐与生成式字幕生成取得了 SOTA 结果。尽管零样本迁移能力已被充分记录,但这些生成-对比混合模型在极端数据稀缺(少样本学习)的下游任务中的适配仍探索不足。现有文献主要关注像 CLIP 这样的双编码器架构,在理解 CoCa 独特的潜在空间如何响应参数高效微调(PEFT)方面留下了空白。本文对适配 CoCa 视觉骨干网络用于少样本图像分类进行了全面的经验性研究。我们系统地评估了从免训练的混合原型设计到通过低秩适配(LoRA)进行深度参数适配的层次化策略。首先,我们识别出一种“增强发散”:虽然强数据增强在低样本设置中会降低线性探测的性能,但它对于稳定 LoRA 微调至关重要。我们还证明了结合监督对比(SupCon)损失的混合目标在不同样本数量下比标准交叉熵产生一致的性能提升。至关重要的是,我们表征了训练配置对数据稀缺的敏感性,为缩放正则化、秩和采样策略提供了经验参考设置,以促进生成-对比基础模型的高效适配。
引用
@article{arxiv.2512.12824,
title = {Adapting Multimodal Foundation Models for Few-Shot Learning: A Comprehensive Study on Contrastive Captioners},
author = {N. K. B. M. P. K. B. Narasinghe and Uthayasanker Thayasivam},
journal= {arXiv preprint arXiv:2512.12824},
year = {2025}
}
备注
9 pages, 3 figures. Accepted to VISAPP 2026