中文

自证式解码:解锁LVLMs中的视觉搜索

计算机视觉与模式识别 2026-05-28 v1

摘要

大型视觉语言模型(LVMMs)正快速演进向真正的多模态推理迈进,视觉搜索代表了以图像为思考工具范式的具体实现。然而,LVMM视觉搜索面临两个关键挑战:后训练后各内在能力之间的不兼容性,以及长多步骤推理上下文中的干扰。为此,我们识别了两种新见解:首先,预后训练LVMM之间的自调节利用了预训练模型的内在单步骤能力,以缓解能力退化和长上下文干扰。其次,基于概率的预言性采样取代简单提示,提供了一个概率接口,其中预训练模型充当先知,后训练模型在其输出分布下选择性接受预言标记,保持连贯的多步骤推理。建立在这些见解之上,我们引入SeProD,即一种自证式解码框架,它利用内在单步骤能力在不添加计算开销的情况下,启用了预训练模型中持续性的多步骤推理。实验表明,SeProD在4个视觉搜索基准测试的12个划分以及多个通用VQA基准测试中均一致性改进,得益于其并行的预言接受机制。

关键词

引用

@article{arxiv.2605.28741,
  title  = {Self-Prophetic Decoding to Unlock Visual Search in LVLMs},
  author = {Zhendong He and Qiyuan Dai and Guanbin Li and Liang Lin and Sibei Yang},
  journal= {arXiv preprint arXiv:2605.28741},
  year   = {2026}
}

备注

Accepted at ICML 2026