中文

双模态锚点引导滤波用于测试时提示调优

计算机视觉与模式识别 2026-04-15 v1

摘要

测试时提示调优利用增强视图来适应视觉-语言模型,但其有效性受到确定哪些视图有益的挑战的阻碍。基于标准熵的滤波依赖于模型内部的置信度分数,这些分数在分布偏移下常常校准不佳,会将高置信度分配给不相关的裁剪区域或背景区域,而忽略语义内容。为解决此问题,我们提出一个双模态锚点引导框架,将视图选择建立在语义证据之上。我们引入一个来自属性丰富描述的文本锚点,以提供细粒度的类别语义,以及一个自适应图像锚点,用于捕获不断变化的测试时统计信息。利用这些锚点,我们基于对齐度和置信度对视图进行滤波,确保只有信息量丰富的视图引导适应。此外,我们将锚点视为辅助预测头,并将其预测与原始输出以置信度加权集成的方式结合,为提示更新提供稳定的监督信号。在15个基准数据集上的大量实验证明了新的最先进性能,凸显了锚点引导监督作为鲁棒提示更新基础的作用。

关键词

引用

@article{arxiv.2604.12403,
  title  = {Dual-Modality Anchor-Guided Filtering for Test-time Prompt Tuning},
  author = {Jungwon Choi and Eunwoo Kim},
  journal= {arXiv preprint arXiv:2604.12403},
  year   = {2026}
}

备注

Accepted by CVPR 2026 findings