中文

TextRefiner:内部视觉特征作为视觉语言模型提示调优的高效精修器

计算机视觉与模式识别 2024-12-12 v1 多媒体

摘要

尽管提示学习在将视觉语言模型(VLMs)迁移至下游任务方面具有高效性,现有方法主要以粗粒度方式学习提示,即学到的提示向量在所有类别间共享。因此,针对性提示往往无法区分类别特定的视觉概念,从而阻碍了共享相似或复杂视觉属性的类别的迁移性能。近期进展通过利用大语言模型(LLMs)的外部知识来提供类别描述以缓解这一挑战,但带来了显著的推理开销。在本论文中,我们提出 TextRefiner,一种即插即用的方法,通过利用 VLMs 的内部知识来精修现有方法的文本提示。特别是,TextRefiner 构建了一个新颖的局部缓存模块,用于封装从图像分支的局部标记中导出的细粒度视觉概念。通过聚合和对齐缓存的视觉描述与文本分支的原始输出,TextRefiner 可以高效地精修和丰富现有方法学到的提示,而无需依赖任何外部专业知识。例如,它将 CoOp 在 11 个基准上的性能从 71.66% 提升至 76.94%,超越了引入实例级特征用于文本提示的 CoCoOp。配备 TextRefiner 后,PromptKD 取得了最先进性能且推理高效。我们的代码已发布于 https://github.com/xjjxmu/TextRefiner。

关键词

引用

@article{arxiv.2412.08176,
  title  = {TextRefiner: Internal Visual Feature as Efficient Refiner for Vision-Language Models Prompt Tuning},
  author = {Jingjing Xie and Yuxin Zhang and Jun Peng and Zhaohong Huang and Liujuan Cao},
  journal= {arXiv preprint arXiv:2412.08176},
  year   = {2024}
}

备注

Accepted by AAAI2025