面向视觉语言模型的层次化跨模态提示学习
计算机视觉与模式识别
2025-08-15 v2
摘要
预训练视觉语言模型(VLM)如 CLIP 显示出卓越的泛化能力。然而,在保持其泛化能力的同时将这些大规模模型适应下游任务仍然具有挑战性。虽然提示学习方法显示出前景,但它们受到两个根本性瓶颈的限制,限制了泛化能力:(a) 模态隔离,和 (b) 层次化语义衰减。为解决这些限制,我们提出了 HiCroPL,一种层次化跨模态提示学习框架,通过在文本和视觉模态之间建立双向知识流,使它们能够相互细化其语义。HiCroPL 通过利用文本和视觉的互补优势来路由知识流。在早期层面,文本提示通过层次化知识映射器将较为清晰的语义注入视觉提示中,增强了低层视觉语义的表示。在后期层面,编码特定任务相关对象的视觉提示流回以细化文本提示,实现更深入的对齐。关键的是,我们的层次化知识映射器允许多尺度表示被融合,确保更深的表示保留可迁�的浅层语义,从而增强泛化能力。我们进一步引入了轻量级的层次化知识代理,以实现高效的跨模态交互。在四个任务上的大规模评估表明,HiCroPL 在性能方面显示出优越性,在 11 个基准测试中实现了最先进的结果,取得了显著的改进。代码可在 https://github.com/zzeoZheng/HiCroPL 上获取。
引用
@article{arxiv.2507.14976,
title = {Hierarchical Cross-modal Prompt Learning for Vision-Language Models},
author = {Hao Zheng and Shunzhi Yang and Zhuoxin He and Jinfeng Yang and Zhenhua Huang},
journal= {arXiv preprint arXiv:2507.14976},
year = {2025}
}
备注
Accepted by ICCV2025