中文

受约束的提示增强:提高视觉语言模型零样本泛化性

计算机视觉与模式识别 2025-08-26 v1

摘要

视觉语言模型(VLMs)在 web 规模数据上预训练后展现出良好的零样本泛化能力,但由于预训练与下游任务之间的领域差距,常常出现语义错位。现有方法主要关注类特定描述的文本提示以及通过对齐裁剪图像区域与文本描述实现视觉-文本适应。然而,这些方法仍面临文本提示不完整和视觉提示噪声的问题。本文提出一种新颖的受约束提示增强(CPE)方法,通过从语义角度构建全面的文本提示和紧凑的视觉提示来改善视觉-文本对齐。具体而言,我们的方法包含两个关键组件:拓扑引导的同义语义生成(TGSSG)和类别无关的判别区域选择(CADRS)。在文本方面,为解决文本提示中语义表达不完整的问题,TGSSG 首先通过大语言模型为每个类别生成同义语义集合,并基于语义歧义熵和持久同调分析构建全面的文本提示。在视觉方面,为缓解随机裁剪引入的无关视觉噪声,CADRS 通过预训练视觉模型输出的激活图识别判别性区域,有效过滤噪声区域并生成紧凑的视觉提示。基于测试时适应(TTA)和最优传输(OT)的两个集合到集合匹配策略,实现了有效的视觉-文本对齐,从而提升了 VLMs 的零样本泛化能力。

关键词

引用

@article{arxiv.2508.17417,
  title  = {Constrained Prompt Enhancement for Improving Zero-Shot Generalization of Vision-Language Models},
  author = {Xiaojie Yin and Qilong Wang and Qinghua Hu},
  journal= {arXiv preprint arXiv:2508.17417},
  year   = {2025}
}