中文

MM-CondChain:面向视觉 grounding 深度组合推理的可程序化验证基准

计算机视觉与模式识别 2026-03-13 v1

摘要

多模态大语言模型(MLLM)正在越来越多地用于执行视觉工作流程,例如导航图形用户界面,在此场景下,下一步操作取决于验证的视觉组合条件(例如"若出现权限对话框且界面颜色为绿色,则点击Allow"),且过程可能在此前提下分支或提前终止。然而,这一能力仍未得到充分评估:现有基准仅聚焦于浅层组合或独立约束,而非深度链式组合条件。在本文中,我们引入MM-CondChain——一个针对视觉 grounding 深度组合推理的基准。每个基准实例以多层推理链形式组织,其中每一层包含以视觉证据为 grounding 的非平凡组合条件,由多个对象、属性或关系构成。要正确回答,MLLM必须对图像进行细粒度感知,在每一步进行多元素推理,并遵循相应的执行路径以得出最终结果。为可扩展构建此类工作流程式数据,我们提出一种智能体合成管道:Planner按层生成组合条件,而可程序化验证中间表示(VPIR)确保每一层条件可被机械验证。Composer随后将这些经验证的层构建为完整指令。借助此管道,我们在三个视觉领域构建了基准:自然图像、数据图表和GUI轨迹。对多种MLLM进行实验表明,即便是最强的模型也仅能达到53.33的Path F1得分,在硬负例以及深度或谓词复杂度提升时表现显著下降,确认了深度组合推理仍是根本性挑战。

关键词

引用

@article{arxiv.2603.12266,
  title  = {MM-CondChain: A Programmatically Verified Benchmark for Visually Grounded Deep Compositional Reasoning},
  author = {Haozhan Shen and Shilin Yan and Hongwei Xue and Shuaiqi Lu and Xiaojun Tang and Guannan Zhang and Tiancheng Zhao and Jianwei Yin},
  journal= {arXiv preprint arXiv:2603.12266},
  year   = {2026}
}

备注

Project Page: https://accio-lab.github.io/MM-CondChain