视觉的代价:在单体范式中实现可信的多模态推理
计算机视觉与模式识别
2026-05-22 v2 人工智能
摘要
视觉-语言模型(VLM)的迅速普及常被描述为能够实现统一的多模态知识发现,但这建立在一个未经充分检验的假设之上:当前的VLM能够忠实地合成多模态数据。我们认为它们通常做不到,这一差距反映了主流视觉编码器-投影器-大语言模型(LLM)范式中的可信度问题。最先进的模型并非从视觉输入中提取有根据的知识,而是经常表现出功能性盲视,即利用强大的语言先验来绕过严重的视觉表征瓶颈。在这项工作中,我们挑战了依赖数据消融或创建新数据集,从而将数据集偏差与架构能力不足混为一谈的传统多模态评估方法。我们提出了一种信息论的替代方案:模态转换协议,旨在量化我们所谓的“视觉的代价”。通过转换语义载荷而非消融它们,我们制定了三个新颖的度量指标——视觉的通行费(ToS)、诅咒(CoS)和谬误(FoS)——最终形成语义充分性准则(SSC)。此外,我们提出了一个多模态缩放的分歧定律假说:随着底层语言引擎扩展到前所未有的推理能力,视觉知识瓶颈的代价可能会增加而非减少。我们认为,社区应该超越将“多模态增益”作为主要评估目标的做法。通过将SSC从被动的诊断约束提升为主动的架构蓝图,我们为引导下一代人工智能系统走向真正的多模态推理奠定了基础。
引用
@article{arxiv.2604.20665,
title = {The Expense of Seeing: Attaining Trustworthy Multimodal Reasoning Within the Monolithic Paradigm},
author = {Karan Goyal},
journal= {arXiv preprint arXiv:2604.20665},
year = {2026}
}
备注
Addresses practical viability of Vlabel construction. Writing is grounded. Acknowledgement is duly added