中文

一种认知范式用于探索视觉-推理接口中的认知机制

计算机视觉与模式识别 2025-05-07 v5 人工智能

摘要

人工智能中的一个根本性挑战在于理解支撑视觉推理的认知机制,尤其是对于像 Vision-Language 模型 (VLM) 这样的复杂模型。这些模型如何整合视觉感知与抽象思维,尤其是在跨多个图像进行推理或需要精细构成理解时?本文受认知科学的启发,提出一种结构化评估框架,利用多样化的视觉推理任务(Bongard 问题和 Winoground)来剖析 VLM 中的感知-推理接口。我们提出三种不同的评估范式,模仿人类问题解决策略:直接视觉规则学习 (DVRL; 整体处理)、演绎规则学习 (DRL; 规则提取与应用) 和构件分析 (CA; 通过任务无关文本描述的分析分解)。这些范式系统性地变化认知负荷,探究处理阶段。值得注意的是,CA 通过对文本描述进行推理,能够即使针对单图像架构也实现多图像推理,并将推理与感知隔离。将该框架应用于实际应用后,我们证明 CA 在挑战性基准测试(包括 Bongard-OpenWorld、Bongard-HOI 和 Winoground)上取得了新的最先进 (SOTA) 性能。消融研究确认,当感知挑战被缓解时,推理性能显著提升,揭示了关键的感知瓶颈。我们的框架提供了一个有价值的诊断工具,表明通过丰富且任务无关的描述来分离感知与推理是实现稳健和通用视觉智能的有前景的方向。

关键词

引用

@article{arxiv.2501.13620,
  title  = {A Cognitive Paradigm Approach to Probe the Perception-Reasoning Interface in VLMs},
  author = {Mohit Vaishnav and Tanel Tammet},
  journal= {arXiv preprint arXiv:2501.13620},
  year   = {2025}
}