中文

V-ABS:面向动态视觉推理的动作-观察者驱动束搜索

计算机视觉与模式识别 2026-05-12 v1 计算与语言

摘要

多模态大语言模型(MLLMs)在通用感知方面取得了显著成功,但复杂的多步视觉推理仍然是一个持续的挑战。尽管近期的智能体方法引入了工具使用,但它们往往忽略了关键的执行反馈。因此,它们存在想象-动作-观察者(IAO)偏差,即先验想象与观察者反馈之间的错位,这破坏了推理的稳定性和最优性。为了弥合这一差距,我们提出了 V-ABS,一个动作-观察者驱动的束搜索框架,通过思考者-动作执行者-观察者迭代实现深思熟虑的推理。我们还提出了一种基于熵的自适应加权算法,通过动态平衡策略先验与观察反馈之间的置信度分数来缓解 IAO 偏差。此外,我们构建了一个包含超过 80k 样本的大规模监督微调(SFT)数据集,以引导模型为正确的动作路径分配更高的先验置信度。在八个不同的基准上的广泛实验表明,V-ABS 实现了 SOTA 性能,在 Qwen3-VL-8B 基线上平均提升了 19.7%,并在开源和专有模型上均取得了一致的增益。

关键词

引用

@article{arxiv.2605.10172,
  title  = {V-ABS: Action-Observer Driven Beam Search for Dynamic Visual Reasoning},
  author = {Zhiwei Ning and Xuanang Gao and Jiaxi Cao and Gengming Zhang and Shengnan Ma and Wenwen Tong and Hanming Deng and Jie Yang and Wei Liu},
  journal= {arXiv preprint arXiv:2605.10172},
  year   = {2026}
}