别闪烠:多模态推理中的证据坍缩证据
人工智能
2026-04-07 v1
摘要
推理视觉语言模型在逐步变得更准确的同时,可能逐渐丢失视觉 grounding。这会导致低熵预测在置信度较高但缺乏依据的情境中形成,这是一种仅靠文本监控难以检测的风险模式。我们在 MathVista、HallusionBench 和 MMMU_Pro 上评估了三种推理 VLMs,发现普遍存在证据坍缩现象:随着推理展开,对标注证据区域的注意力显著下降,常丢失超过一半的证据质量。全响应熵是跨数据集迁移下最可靠的文本置信度信号,但加入视觉特征的单一全局线性规则脆弱且常会降低迁移性能。一种熵-视觉交互模型揭示了任务条件下的该 regimes:在持续视觉参考任务中,低熵且视觉不参与的预测危险,但在符号任务中则良性。基于此结构,针对性的视觉否决可在 90% 覆盖率下将选择性风险降低最高 1.9 个百分点,同时避免在预期不参与情境中的性能下降。结果支持在分布迁移下进行任务感知的多模态监控,以实现安全部署。
引用
@article{arxiv.2604.04207,
title = {Don't Blink: Evidence Collapse during Multimodal Reasoning},
author = {Suresh Raghu and Satwik Pandey},
journal= {arXiv preprint arXiv:2604.04207},
year = {2026}
}
备注
8 pages, 6 figures, 1 table, plus appendix. Submitted to UAI 2026