稀疏最优传输下的局部-全局提示学习
计算机视觉与模式识别
2026-03-10 v1
摘要
few-shot 适应类比 CLIP 等视觉语言模型 (VLM) 通常依赖学习匹配全局图像嵌入的文本提示。近期研究通过融入局部图像-文本对齐来捕获细粒度视觉线索,但这些方法往往为每个提示独立选择局部区域,导致局部特征冗余使用和提示重叠。我们提出 SOT-GLP,通过引入共享稀疏 patch 支持和平衡最优传输分配,显式地在保持全局对齐的同时,将显著视觉区域在类别特定局部提示之间划分。该方法学习共享全局提示和类别特定局部提示。全局分支维持标准的图像-文本匹配,以实现鲁棒的类别级对齐。局部分支通过 V-V 注意力构建类别条件稀疏 patch 集,并通过平衡熵最优传输对齐至多个类别特定提示,生成防止提示重叠和坍缩的软划分 patch。我们在两个互补目标上评估该方法:(i) 在 11 个标准基准数据集上的 few-shot 分类准确率,以及 (ii) 越界 (OOD) 检测。在 16-shot ViT-B/16 的标准 11 数据集基准测试中,SOT-GLP 实现了 85.1% 的平均准确率,超越了以往的提示学习方法。在提示学习中,我们发现显著的准确率-鲁棒性权衡:虽然可学习的投影可优化准入分布拟合,但会改变基础特征空间。我们展示了无投影的局部对齐可保留 CLIP 流形的原生几何结构,从而实现了最高的 OOD 检测性能 (94.2% AUC),超越完全适应的模型。实现代码已公开:https://github.com/Deniz2304988/SOT-GLP
关键词
引用
@article{arxiv.2603.08347,
title = {Local-Global Prompt Learning via Sparse Optimal Transport},
author = {Deniz Kizaroğlu and Ülku Tuncer Küçüktas and Emre Çakmakyurdu and Alptekin Temizel},
journal= {arXiv preprint arXiv:2603.08347},
year = {2026}
}
备注
9 pages, 3 figures, 4 tables. Code available at GitHub