V-REX:基于链式问题的探索式视觉推理基准
计算机视觉与模式识别
2025-12-16 v1 人工智能
机器学习
摘要
虽然许多视觉语言模型(VLMs)被开发用于回答高度指定目标的简单问题,如大多数基准中所示,但它们在实际应用中常常在处理复杂的开放性任务时表现不佳,这类任务通常需要在视觉空间中进行多轮探索和推理。这种视觉思考路径不仅为AI侦探提供了逐步的探索与验证过程,也能产生对最终答案更好的解释。然而,这些路径因中间步骤的探索空间庞大而难以评估。为弥合这一差距,我们开发了一个评估套件“视觉推理与多步探索(V-REX)”,由需要本机多步探索的挑战性视觉推理任务基准及评估协议组成。V-REX涵盖了多样化领域的丰富应用场景。V-REX将多步探索式推理转化为链式问题(Chain-of-Questions, CoQ),并离散化VLMs的能力,包括(1)规划:通过选择一系列探索性问题来分解开放性任务;以及(2)跟随:依次回答精选的CoQ以收集信息以得出最终答案。通过为每一步精选问题和答案的有限选项,V-REX实现了对中间步骤的可靠定量和细粒度分析。通过评估最新专有和开源VLMs,我们揭示了一致的规模趋势,发现规划能力与跟随能力之间存在显著差异,以及在多步探索式推理方面仍有大量提升空间。
引用
@article{arxiv.2512.11995,
title = {V-REX: Benchmarking Exploratory Visual Reasoning via Chain-of-Questions},
author = {Chenrui Fan and Yijun Liang and Shweta Bhardwaj and Kwesi Cobbina and Ming Li and Tianyi Zhou},
journal= {arXiv preprint arXiv:2512.11995},
year = {2025}
}
备注
28 pages