检索反事实示例提升视觉情境学习
计算机视觉与模式识别
2026-03-18 v1 人工智能
计算与语言
摘要
视觉语言模型(VLM)在广泛的多模态推理任务上取得了令人瞩目的性能,但它们往往难以消解细粒度视觉属性并推理关于底层因果关系的问题。情境学习(ICL)为 VLM 适应新任务提供了有前景的途径,但其效果关键取决于示例选择。现有的检索增强方法通常依赖于被动的基于相似性的检索,这倾向于选择相关但非因果的示例,放大虚假关联,限制模型的鲁棒性。我们引入 CIRCLES(Composed Image Retrieval for Causal Learning Example Selection),一个新框架,通过针对性的、基于属性的构件图像检索主动构建演示集,以检索反事实样式的示例。通过包含反事实样式的示例,CIRCLES 使 VLM 能够隐式推理属性与结果之间的因果关系,超越表面关联,培育更稳健且更具根基的推理。对四个多样化数据集进行的全面实验表明,CIRCLES 在各种架构上都显著优于现有方法,尤其在小规模模型上表现更佳,在信息稀缺情况下的提升尤为显著。此外,CIRCLES 检索出更多样且在因果层面更具信息性的示例,提供了关于模型如何利用情境演示以实现改进推理的定性见解。我们的代码可在 https://github.com/gzxiong/CIRCLES 获取。
引用
@article{arxiv.2603.16737,
title = {Retrieving Counterfactuals Improves Visual In-Context Learning},
author = {Guangzhi Xiong and Sanchit Sinha and Zhenghao He and Aidong Zhang},
journal= {arXiv preprint arXiv:2603.16737},
year = {2026}
}
备注
CVPR 2026