面向全局最优的视觉上下文学习提示选择
计算机视觉与模式识别
2024-10-11 v2
摘要
视觉上下文学习(VICL)是一种通过利用上下文示例中包含的上下文信息来增强查询样本的学习和预测,从而将视觉基础模型迁移到新任务的流行方法。VICL中的基本问题是如何选择最佳提示以尽可能激活其能力,这等价于排序问题,即测试候选集中每个候选的上下文行为并选择最佳者。为了利用更合适的排序指标并利用候选集中更全面的信息,我们提出了一种新颖的上下文示例选择框架,以近似识别全局最优提示,即为每个查询样本从所有候选中选择性能最佳的上下文示例。我们的方法名为Partial2Global,采用基于Transformer的列表式排序器在多个候选中提供更全面的比较,以及一个一致性感知的排序聚合器以生成全局一致的排序。通过在前景分割、单目标检测和图像着色上的实验验证了Partial2Global的有效性,表明Partial2Global相比其他方法始终选择更好的上下文示例,从而建立了新的最先进水平。
引用
@article{arxiv.2405.15279,
title = {Towards Global Optimal Visual In-Context Learning Prompt Selection},
author = {Chengming Xu and Chen Liu and Yikai Wang and Yuan Yao and Yanwei Fu},
journal= {arXiv preprint arXiv:2405.15279},
year = {2024}
}