面向视觉语言模型的属性基视觉重编程
计算机视觉与模式识别
2025-02-26 v2 机器学习
摘要
视觉重编程(VR)通过向输入添加可训练噪声模式来复用预训练视觉模型,用于下游图像分类任务。应用于视觉语言模型(如CLIP)时,现有VR方法遵循与视觉模型(如ResNet、ViT)相同的流程,将ground-truth类别标签插入固定文本模板,以引导VR模式的优化。这种基于标签的方法忽略了CLIP可利用的丰富信息和多样化属性导向文本表示,可能导致样本误分类。本文提出面向CLIP的属性基视觉重编程方法(AttrVR),利用描述性属性(DesAttrs)和区别性属性(DistAttrs),分别代表不同类别的常见特征描述和独特特征描述。此外,由于相同类别的图像在VR后可能反映不同的属性,AttrVR采用针对每个图像样本的k近DesAttrs和DistAttrs进行迭代式模式优化,实现更动态、样本特定的优化。理论上,AttrVR可降低类内方差并增大类间间隔。实证上,在针对ViT基和ResNet基CLIP的12个下游任务中,AttrVR实现了卓越的性能。AttrVR的成功促进了将单模态视觉模型的VR更有效地集成到视觉语言模型中。我们的代码已公开于https://github.com/tmlr-group/AttrVR。
引用
@article{arxiv.2501.13982,
title = {Attribute-based Visual Reprogramming for Vision-Language Models},
author = {Chengyi Cai and Zesheng Ye and Lei Feng and Jianzhong Qi and Feng Liu},
journal= {arXiv preprint arXiv:2501.13982},
year = {2025}
}