MIRAGE:视觉理解的幻象
人工智能
2026-04-03 v3
摘要
多模态 AI 系统在广泛的实际任务中取得了显著的性能,但关于这些系统如何处理和整合视觉信息的机制仍然令人惊讶地不被充分理解。我们报告了三项发现,这些发现挑战了关于这些系统如何处理视觉信息的 prevailing 假设。第一,前沿模型能够为从未提供的图像生成详细的图像描述和精心构造的推理轨迹,包括病理学偏见的临床发现,我们称之为幻象推理。第二,在没有任何图像输入的情况下,模型仍能在一般和医学多模态基准测试中取得惊人的高分,这质疑了它们的实用性和设计。在最极端的情况下,我们的模型在标准胸片问答基准测试中获得了第一名,尽管未获得任何图像。第三,当模型被明确指示在没有图像访问的情况下猜测答案,而不是被隐式提示假设图像存在时,性能会显著下降。明确的猜测似乎会激活更保守的响应 regime,而幻象 regime 中的模型则表现为仿佛提供了图像。这些发现揭示了视觉-语言模型推理方式中的根本性漏洞,指出迫切需要采用消除文本线索以便进行非视觉推理的私有基准,特别是在医疗领域,因为不准确的 AI 代价更大。我们提出了 B-Clean,用于对多模态 AI 系统进行公正、基于视觉的评估。
引用
@article{arxiv.2603.21687,
title = {MIRAGE: The Illusion of Visual Understanding},
author = {Mohammad Asadi and Jack W. O'Sullivan and Fang Cao and Tahoura Nedaee and Kamyar Rajabalifardi and Fei-Fei Li and Ehsan Adeli and Euan Ashley},
journal= {arXiv preprint arXiv:2603.21687},
year = {2026}
}