迈向可靠且全面的视觉上下文学习提示选择
计算机视觉与模式识别
2025-10-20 v2
摘要
视觉上下文学习 (VICL) 已成为一种将视觉基础模型适配到新任务的突出方法,它通过有效利用上下文示例中嵌入的上下文信息来实现,这可以表述为潜在候选者的全局排序问题。当前的 VICL 方法,如 Partial2Global 和 VPR,基于相似度优先假设,即与查询图像视觉上更相似的图像可作为更好的上下文示例。这一基础假设虽然直观,但缺乏对其在选择最优上下文示例中有效性的充分论证。此外,Partial2Global 从一系列随机采样的成对偏好预测中构建其全局排序。这种对随机采样的依赖可能导致比较的覆盖不完整和采样冗余,从而进一步对最终的全局排序产生不利影响。为了解决这些问题,本文引入了 Partial2Global 的一个增强变体,旨在为 VICL 中上下文示例提供可靠且全面的选择。我们提出的方法被称为 RH-Partial2Global,利用刀切法共形预测引导策略构建可靠的备选集,并采用基于覆盖设计的采样方法以确保对成对偏好的全面且均匀的覆盖。大量实验表明,RH-Partial2Global 取得了优异的性能,并在多种视觉任务中优于 Partial2Global。
引用
@article{arxiv.2509.25989,
title = {Towards Reliable and Holistic Visual In-Context Learning Prompt Selection},
author = {Wenxiao Wu and Jing-Hao Xue and Chengming Xu and Chen Liu and Xinwei Sun and Changxin Gao and Nong Sang and Yanwei Fu},
journal= {arXiv preprint arXiv:2509.25989},
year = {2025}
}
备注
Accepted by NeurIPS 2025