通过语义探索发现视觉提示
计算机视觉与模式识别
2026-03-18 v1 人工智能
摘要
大型视觉语言模型在图像理解和视觉推理方面面临重大挑战,导致关键感知失败。融合图像操作代码的视觉提示在缓解这些问题方面显示出前景。虽然已成为有前景的方向,但针对视觉提示生成的以往方法仅侧重于工具选择,而未诊断和缓解大型视觉语言模型感知失败的根本原因。鉴于大型视觉语言模型的不可见性和不可预测性,最优视觉提示必须通过经验实验发现,这些实验依赖人工试错。我们提出了一个用于发现任务级视觉提示的自动化语义探索框架。我们的 метод能够通过代理驱动的实验实现多样且高效的探索,最小化人工干预,避免逐样本生成的低效。我们引入了称为 SEVEX 的语义探索算法,旨但解决视觉提示探索的两个主要挑战:(1)长期低层代码带来的干扰;(2)视觉提示广泛且非结构化的搜索空间。具体而言,我们的方法将抽象概念空间作为搜索空间,引入受新颖性指导的选择算法,并通过语义反馈驱动的构思过程,以有效方式探索基于经验结果的多样化视觉提示。我们在 BlindTest 和 BLINK 基准测试上对 SEVEX 进行评估,这些基准测试旨但评估大型视觉语言模型的感知。实验结果表明,SEVEX 在任务准确率、推理效率、探索效率和探索稳定性方面显著优于基线方法。值得注意的是,我们的框架发现了超越常规工具用法的精妙且反直觉的视觉策略,为通过自动化、任务级视觉提示提升大型视觉语言模型感知提供了新范式。
引用
@article{arxiv.2603.16250,
title = {Visual Prompt Discovery via Semantic Exploration},
author = {Jaechang Kim and Yotaro Shimose and Zhao Wang and Kuang-Da Wang and Jungseul Ok and Shingo Takamatsu},
journal= {arXiv preprint arXiv:2603.16250},
year = {2026}
}