中文

无参与感知:剖析 LMM 中的因果发现缺陷

计算与语言 2026-05-12 v1 计算机视觉与模式识别

摘要

尽管大型多模态模型(LMM)在通用视频理解上取得了强劲性能,但它们在因果发现过程中对文本先验捷径的易感性已被认为是一个关键缺陷。由于现有基准仅衡量回答准确性而未揭示缺陷的来源和程度,这一现象的潜在机制仍未被完全理解。我们引入了 ProCauEval,一种基于扰动的评估协议,从结果评估转向机制诊断,通过五种受控配置探究因果发现,这些配置系统地操纵视觉和文本模态,以分解它们对模型行为的各自贡献并剖析失败模式。对 17 个主流 LMM 的评估发现,模型忠实地感知了视频内容,但在因果推理过程中却系统性地未充分利用它。我们进一步观察到,更强的后训练放大而非缓解了对文本先验的依赖,且更高的基线性能与扰动下更大的脆弱性相关。为解决这些问题,我们提出了反蒸馏策略优化(ADPO),一种基于负教师对齐的强化学习框架,它通过显式地将策略推离由视觉损坏诱导的仅先验反事实教师来增强 GRPO。具体而言,ADPO 最大化在原始输入和视觉损坏输入条件下策略分布之间的散度,从而迫使模型将其推理建立在视觉证据而非文本捷径上。大量实验表明,ADPO 在不牺牲基本理解能力的情况下提升了视觉参与度,从而为可靠的因果发现提供了初步步骤。

关键词

引用

@article{arxiv.2605.09422,
  title  = {Perception Without Engagement: Dissecting the Causal Discovery Deficit in LMMs},
  author = {Jiafeng Liang and Zhihao Zhu and Zihan Zhang and Baoqi Ren and Shixin Jiang and Runxuan Liu and Tao Ren and Ming Liu and See-Kiong Ng and Bing Qin},
  journal= {arXiv preprint arXiv:2605.09422},
  year   = {2026}
}

备注

17 pages, 5 figures