用于微调视觉-语言模型的局部化隐空间更新
计算机视觉与模式识别
2022-12-14 v1 计算与语言
机器学习
摘要
尽管像 CLIP 这样的大规模预训练视觉-语言模型在许多任务上展现出令人印象深刻的泛化能力,但为在特定数据集上提升性能,往往仍需对其进行微调。在此过程中,期望模型更新快速,且模型不丧失在数据集之外数据上的能力,而经典微调方法常出现此类能力退化。本文提出一种轻量适配器,仅更新模型在已观测数据点附近的预测。我们在少样本学习场景下证明了这一相对简单方法的有效性与速度,其在训练时可见与未见类别上的结果均与最先进水平相当或有所提升。
引用
@article{arxiv.2212.06556,
title = {Localized Latent Updates for Fine-Tuning Vision-Language Models},
author = {Moritz Ibing and Isaak Lim and Leif Kobbelt},
journal= {arXiv preprint arXiv:2212.06556},
year = {2022}
}