中文

ViC-Bench:利用自由格式中间状态表示评估多模态大语言模型的视觉交错思维链能力

计算机视觉与模式识别 2025-12-30 v3

摘要

视觉交错思维链(Visual-Interleaved Chain-of-Thought, VI-CoT)使多模态大语言模型(Multi-modal Large Language Models, MLLMs)能够基于逐步的中间视觉状态(IVS)持续更新其理解和决策空间,如同人类一样,这在各种任务中展现了令人瞩目的成功,从而推动了相关下游基准测试的涌现与进步。尽管取得了有希望的进展,但当前的基准测试为模型提供的是相对固定的 IVS,而非自由格式的 IVS,这可能会强行扭曲原始的思维轨迹,无法评估其内在的推理能力。更重要的是,现有基准测试忽略了系统性地探索 IVS 对未受约束的推理性能的影响因素。为了填补上述空白,我们引入了一个名为 ViC-Bench 的专用基准测试,包含四个代表性任务,即迷宫导航、拼图、具身长程规划以及复杂计数,其中每个任务都有支持自适应函数调用的专用自由格式 IVS 生成流程。为了系统性地检验 VI-CoT 能力,我们提出了一套全面的评估套件,结合了渐进式三阶段策略和针对性的新指标。此外,我们建立了增量提示信息注入策略,以消融探究 VI-CoT 的提示因素。我们对 18 个先进的 MLLM 进行了广泛评估,揭示了关于其 VI-CoT 能力的关键见解。所引入的 ViC-Bench 已在 Huggingface 上公开发布。

关键词

引用

@article{arxiv.2505.14404,
  title  = {ViC-Bench: Benchmarking Visual-Interleaved Chain-of-Thought Capability in MLLMs with Free-Style Intermediate State Representations},
  author = {Xuecheng Wu and Jiaxing Liu and Danlei Huang and Yifan Wang and Yunyun Shi and Kedi Chen and Junxiao Xue and Yang Liu and Chunlin Chen and Hairong Dong and Dingkang Yang},
  journal= {arXiv preprint arXiv:2505.14404},
  year   = {2025}
}