LaViP:基于语言的视觉提示
计算机视觉与模式识别
2023-12-19 v1 计算与语言
机器学习
摘要
我们引入了一种基于语言的视觉提示方法,以使视觉语言模型的视觉编码器适应下游任务。通过利用语言集成,我们设计了一种参数高效的策略来调整视觉编码器的输入,消除了修改或增加模型参数的需要。由于这种设计选择,我们的算法甚至可以在黑盒场景中运行,展示了对模型参数访问受限情况的适应性。我们将凭经验证明,与现有技术相比,用语言为视觉提示提供基础可以提高适应的准确性和速度。此外,我们的算法在基类到新类泛化方面表现出色,克服了视觉提示的局限性,并展示了超越已见类别进行泛化的能力。我们在各种图像识别数据集上对我们的方法进行了彻底的评估和评价,例如 EuroSAT、UCF101、DTD 和 CLEVR,涵盖了不同的学习情况,包括 few-shot learning、基类到新类的泛化以及 transfer learning。
引用
@article{arxiv.2312.10945,
title = {LaViP:Language-Grounded Visual Prompts},
author = {Nilakshan Kunananthaseelan and Jing Zhang and Mehrtash Harandi},
journal= {arXiv preprint arXiv:2312.10945},
year = {2023}
}
备注
The 38th Annual AAAI Conference on Artificial Intelligence