中文

BLINK-Twice:你看见了,但你观察到了吗?一个视觉感知推理基准

计算机视觉与模式识别 2025-10-13 v1

摘要

最近,多模态大语言模型(MLLM)取得了快速进展,特别是在增强其推理能力方面。然而,现有的推理基准仍然主要评估基于语言的推理,通常将视觉输入视为可替换的上下文。为填补这一缺口,我们引入了 BLINK-Twice,一个以视觉为中心的推理基准,基于具有挑战性的感知任务。与依赖外部知识不同,我们的任务要求模型仅从视觉内容进行推理,将焦点从基于语言的推理转移到基于图像的推理。与先前的感知基准相比,它超越了浅层感知("看"),要求精细的观察和分析推理("观察")。BLINK-Twice 集成了三个核心组件:七种视觉挑战用于测试视觉推理、强制依赖视觉内容的自然对抗图像对,以及用于细粒度评估推理过程而非仅最终答案的标注推理链。我们评估了 20 个领先的 MLLM,包括 12 个基础模型和 8 个推理增强模型。BLINK-Twice 对当前模型构成了重大挑战。虽然语言空间中的现有推理策略(如思维链或自我批评)可以提升性能,但它们往往导致不稳定且冗余的推理。我们观察到重复图像观察可提升各模型的性能,而主动视觉交互(如 o3 模型所示)凸显了对视觉推理新范式的需求。该数据集公开可用:https://github.com/PicoTrex/BLINK-Twice

关键词

引用

@article{arxiv.2510.09361,
  title  = {BLINK-Twice: You see, but do you observe? A Reasoning Benchmark on Visual Perception},
  author = {Junyan Ye and Dongzhi Jiang and Jun He and Baichuan Zhou and Zilong Huang and Zhiyuan Yan and Hongsheng Li and Conghui He and Weijia Li},
  journal= {arXiv preprint arXiv:2510.09361},
  year   = {2025}
}

备注

Accepted to 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Track on Datasets and Benchmarks