从先验到感知:将视频大语言模型扎根于物理现实
计算机视觉与模式识别
2026-05-07 v1
摘要
尽管视频大语言模型(Video-LLMs)在通用理解方面表现出色,但它们在细粒度物理推理上表现出系统性缺陷。现有的干预方法不仅泛化能力有限,而且从根本上将生成伪影与真正的物理谬误混为一谈。此外,我们发现模型不仅在反物理异常上系统性地失败,而且在视觉事实与统计预期相矛盾的直觉反常场景中也会失败。据此,我们提出了统一归因理论:这种双重失败并非源于感知缺陷,而是源于语义先验主导——推理机制被内部叙事脚本深度劫持。为了解决这个问题,我们构建了程序化对抗课程(PACC),这是首个基于物理定律合成的高保真对抗视频数据集,彻底将视觉伪影与逻辑错误解耦。同时,我们设计了视觉锚定推理链(VARC),以强制模型在逻辑裁决之前明确将其判断扎根于低级视觉事实。实验表明,在没有侵入性架构修改的情况下,使用PACC课程的标准LoRA微调能有效中和最先进(SOTA)模型中的先验干扰,使物理推理能力实现实质性飞跃。
引用
@article{arxiv.2605.04515,
title = {From Priors to Perception: Grounding Video-LLMs in Physical Reality},
author = {Zicheng Zhao and Chaofan Gan and Shijie Li and Weiyao Lin},
journal= {arXiv preprint arXiv:2605.04515},
year = {2026}
}