为解读还是为取悦:揭示视觉型 AI 的视觉俯身现象与分层信念
计算机视觉与模式识别
2026-05-27 v3 人工智能
摘要
当 VLMs 正确回答时,它们是否真正依赖视觉信息?我们提出三层诊断框架,包含三个逐样本度量:潜在异常检测、视觉必要性得分和竞争得分,以分离感知、依赖和对齐故障。在 9 个 VLMs 和 9000 个模型-样本对下进行 counterfactual blind、noise 和 conflict 干预测试后,72.9% 的样本表现出视觉俯身现象,即内部证据被保留但解码出幻觉答案,而零样本显示出稳健拒绝,表明当前对齐训练已消除拒绝作为解码结果。通过扩展 Qwen-VL 系列,无论在同一模型内还是跨模型生成,都单调减少语言捷径但放大视觉俯身现象,表明规模和最新的后训练无法解决 grounding 问题。诊断得分进一步启用一种无训练选择性预测策略,可在 50% 覆盖率下提升约 9.5 个百分点的准确率。
引用
@article{arxiv.2603.18373,
title = {To See or To Please: Uncovering Visual Sycophancy and Split Beliefs in VLMs},
author = {Rui Hong and Shuxue Quan},
journal= {arXiv preprint arXiv:2603.18373},
year = {2026}
}
备注
14 pages, 1 figures