从感知到认知:多模态大型语言模型中视觉语言交互推理的综述
人工智能
2025-10-17 v4
摘要
多模态大型语言模型(MLLMs)致力于实现对物理世界的深刻、类人程度的理解和交互,但往往在获取信息(感知)与进行推理(认知)之间展现出浅薄且不连贯的集成。这种脱节导致推理失败的系列问题,其中最突出的是幻觉现象。这些问题暴露了根本性挑战:感知像素并不等于构建连贯、可信的内部世界模型。为系统性地剖析和解决这一挑战,本综述引入了一种新型且统一的分析框架:“从感知到认知”。我们将视觉语言交互理解的复杂过程解构为两个相互依存的层次:感知——在文本指令基础上准确提取视觉信息并实现细粒度对齐的基础能力;认知——建立在感知基础之上的主动、多步骤、以目标为导向的推理能力,其核心是形成动态的观察-思考-验证推理循环。遵循这一框架,本文系统分析了当前 MLLMs 在两个层面上的关键瓶颈。我们梳理了旨在解决这些挑战的最前沿方法,涵盖从增强低层视觉表征的技术到改进高层推理范式的技术。此外,我们回顾了关键基准并阐明了未来研究方向。本综述旨在为研究社区提供清晰、结构化的视角,以理解当前 MLLMs 的内在局限性,并指明通往下一代能够进行深度推理和真正理解世界的模型之路。
引用
@article{arxiv.2509.25373,
title = {From Perception to Cognition: A Survey of Vision-Language Interactive Reasoning in Multimodal Large Language Models},
author = {Chenyue Zhou and Mingxuan Wang and Yanbiao Ma and Chenxu Wu and Wanyi Chen and Zhe Qian and Xinyu Liu and Yiwei Zhang and Junhao Wang and Hengbo Xu and Fei Luo and Xiaohua Chen and Xiaoshuai Hao and Hehan Li and Andi Zhang and Wenxuan Wang and Kaiyan Zhang and Guoli Jia and Lingling Li and Zhiwu Lu and Yang Lu and Yike Guo},
journal= {arXiv preprint arXiv:2509.25373},
year = {2025}
}