中文

多模态基础模型的少样本适配:综述

计算机视觉与模式识别 2024-01-05 v2

摘要

多模态(视觉-语言)模型,如CLIP,正取代传统的监督预训练模型(例如基于ImageNet的预训练),成为新一代视觉基础模型。这些模型从数十亿互联网图像-文本对中学习到鲁棒且对齐的语义表示,并能以零样本方式应用于各种下游任务。然而,在医学影像和遥感等细粒度领域,多模态基础模型的性能往往不尽如人意。因此,许多研究者开始探索这些模型的少样本适配方法,逐渐衍生出三种主要技术途径:1)基于提示的方法,2)基于适配器的方法,以及3)基于外部知识的方法。然而,这个快速发展的领域产生了大量成果,却缺乏一篇全面的综述来系统性地梳理研究进展。因此,在本综述中,我们介绍并分析了多模态模型少样本适配方法的研究进展,总结了常用数据集和实验设置,并比较了不同方法的结果。此外,由于现有方法缺乏可靠的理论支持,我们推导了多模态模型的少样本适配泛化误差界。该定理揭示了多模态基础模型的泛化误差受三个因素约束:领域差距、模型容量和样本量。基于此,我们从以下方面提出了三种可能的解决方案:1)自适应领域泛化,2)自适应模型选择,以及3)自适应知识利用。

关键词

引用

@article{arxiv.2401.01736,
  title  = {Few-shot Adaptation of Multi-modal Foundation Models: A Survey},
  author = {Fan Liu and Tianshu Zhang and Wenwen Dai and Wenwen Cai and Xiaocong Zhou and Delong Chen},
  journal= {arXiv preprint arXiv:2401.01736},
  year   = {2024}
}