基于表示定理的低样本视觉-语言模型适配综述
计算机视觉与模式识别
2024-10-16 v1
摘要
预训练视觉-语言基础模型的出现彻底改变了零/少样本(即低样本)图像识别领域。在训练数据有限的条件下,关键挑战是如何以参数高效的方式微调预训练的视觉-语言模型。此前,已经提出了许多应对这一挑战的方法。同时,也发表了一些综述论文来总结这些工作。然而,仍然缺乏一个统一的计算框架来整合现有方法,识别其本质并支持深入比较。因此,本综述论文首先从表示定理的角度提出了一个统一的计算框架,然后通过特化该框架推导出许多现有方法。此后,进行了比较分析以揭示现有方法之间的差异和关系。基于这些分析,提出了一些改进现有工作的可能变体。作为演示,我们通过建模再生核希尔伯特空间(RKHS)中表示器之间的类间相关性来扩展现有方法,这是通过利用核岭回归的闭式解来实现的。在11个数据集上进行了大量实验,以验证该方法的有效性。在本文的最后,我们讨论了局限性并提供了进一步的研究方向。
引用
@article{arxiv.2410.11686,
title = {A Survey of Low-shot Vision-Language Model Adaptation via Representer Theorem},
author = {Kun Ding and Ying Wang and Gaofeng Meng and Shiming Xiang},
journal= {arXiv preprint arXiv:2410.11686},
year = {2024}
}