中文

VisuRiddles:细粒度感知是多模态大型语言模型在抽象视觉推理中的主要瓶颈

计算机视觉与模式识别 2025-10-22 v3 人工智能

摘要

多模态大型语言模型(MLLM)的最新进展显著提升了其在许多推理任务上的表现。然而,抽象视觉推理(AVR)仍然是一个关键挑战,这主要归因于对抽象图形感知的局限性。为了解决这一问题,我们研究了当前 MLLM 的瓶颈,并合成了训练数据以改善其抽象视觉感知。首先,我们提出了 VisuRiddles,一个用于 AVR 的基准测试,其任务经过精心构建,以评估模型在五个核心维度和两个高层推理类别上的推理能力。其次,我们引入了感知谜题合成器(PRS),这是一个自动生成带有细粒度感知描述谜题的框架。PRS 不仅为抽象图形生成有价值的训练数据,还提供细粒度的感知描述,这对于监督中间推理阶段至关重要,从而提高了训练效率和模型可解释性。我们在 VisuRiddles 上的大量实验结果实证验证了细粒度视觉感知是主要瓶颈,并且我们的合成框架显著提升了当代 MLLM 在这些具有挑战性的任务上的表现。我们的代码和数据集将发布于 https://github.com/yh-hust/VisuRiddles

关键词

引用

@article{arxiv.2506.02537,
  title  = {VisuRiddles: Fine-grained Perception is a Primary Bottleneck for Multimodal Large Language Models in Abstract Visual Reasoning},
  author = {Hao Yan and Xingchen Liu and Hao Wang and Zhenbiao Cao and Handong Zheng and Liang Yin and Xinxing Su and Zihao Chen and Jihao Wu and Minghui Liao and Chao Weng and Wei Chen and Yuliang Liu and Xiang Bai},
  journal= {arXiv preprint arXiv:2506.02537},
  year   = {2025}
}

备注

13 pages, 4 figures