中文

FDBPL: 基于蒸馏的快速提示学习用于区域感知视觉-语言模型适配

计算机视觉与模式识别 2025-05-26 v1 人工智能

摘要

提示学习作为一种参数高效的方法,已被广泛用于将视觉-语言模型(VLMs)适配到下游任务。虽然硬提示设计需要领域专业知识和迭代优化,但软提示方法严重依赖任务特定的硬标签,限制了其向未见类别的泛化能力。近期流行的基于蒸馏的提示学习方法通过利用更大的教师VLM和无监督知识迁移来提升泛化能力,但其重复的教师模型在线推理牺牲了提示学习固有的训练效率优势。本文提出更快的基于蒸馏的提示学习(FDBPL),通过在多个训练阶段共享软监督上下文并实现加速I/O来解决上述问题。此外,FDBPL引入了一种区域感知提示学习范式,配备双正负提示空间,以充分利用包含多层次信息的随机裁剪区域。我们提出了一种基于相似性-差异性学习的正负空间互学习机制,使学生CLIP模型在识别正确语义的同时学会拒绝弱相关概念,从而提升零样本性能。与现有基于蒸馏的提示学习方法不同,FDBPL在保持参数效率的同时兼顾强下游泛化能力。在11个数据集上的综合评估表明,FDBPL在基线到新类别的泛化、跨数据集迁移和鲁棒性测试中均取得优越性能,训练速度提升2.2倍。

关键词

引用

@article{arxiv.2505.18053,
  title  = {FDBPL: Faster Distillation-Based Prompt Learning for Region-Aware Vision-Language Models Adaptation},
  author = {Zherui Zhang and Jiaxin Wu and Changwei Wang and Rongtao Xu and Longzhao Huang and Wenhao Xu and Wenbo Xu and Li Guo and Shibiao Xu},
  journal= {arXiv preprint arXiv:2505.18053},
  year   = {2025}
}