PANICL:缓解视觉上下文学习中对单一提示的过度依赖
计算机视觉与模式识别
2025-09-29 v1
摘要
视觉上下文学习 (VICL) 使用输入-输出图像对(称为上下文对或示例)作为提示,与查询图像一起引导模型执行各种视觉任务。然而,VICL 经常过度依赖单一上下文对,这可能导致有偏且不稳定的预测。我们提出了基于 Patch 的 -近邻视觉上下文学习 (PANICL),这是一个通用的免训练框架,通过利用多个上下文对来缓解此问题。PANICL 平滑跨对的分配分数,在无需额外训练的情况下减少偏差。在包括前景分割、单目标检测、着色、多目标分割和关键点检测在内的各种任务上的大量实验表明,相较于强基线有一致的提升。此外,PANICL 对领域偏移表现出强大的鲁棒性,包括数据集级偏移(例如,从 COCO 到 Pascal)和标签空间偏移(例如,FSS-1000),并且能很好地泛化到其他 VICL 模型,如 SegGPT、Painter 和 LVM,突显了其多功能性和广泛的适用性。
引用
@article{arxiv.2509.21926,
title = {PANICL: Mitigating Over-Reliance on Single Prompt in Visual In-Context Learning},
author = {Jiahao Zhang and Bowen Wang and Hong Liu and Yuta Nakashima and Hajime Nagahara},
journal= {arXiv preprint arXiv:2509.21926},
year = {2025}
}
备注
21 pages, 12 figures