STEAR: 面向视频大语言模型幻觉缓解的层感知时空证据干预
计算机视觉与模式识别
2026-04-06 v1 多媒体
摘要
视频大语言模型仍容易出现时空幻觉,通常生成缺乏视觉支持的细节或错误的时间关系。现有的缓解方法通常将幻觉视为均匀的解码失败,应用全局共享的修正规则。我们观察到,解码层对视觉定位和后期语言组合的贡献各不相同,表明干预必须是层感知的。基于这一洞察,我们提出了 STEAR,一种层感知的时空证据干预框架。STEAR 识别高风险的解码步骤,并从 grounding 敏感的中间层选择标记条件化的视觉证据。该共享证据用于两个耦合目的:在中间层恢复缺失的局部 grounding,以及构建时间扰动的补丁级反事实以在后期层解码期间证伪不一致的推理。因此,STEAR 在一个高效的单编码推理框架内同时缓解了空间和时间幻觉。在代表性 Video-LLM 骨干网络和具有挑战性基准测试上的实验表明,STEAR 一致地减少了幻觉,同时提升了忠实度、时间一致性和鲁棒性。我们的结果证实,可靠的视频解码依赖于在正确的层上对精确证据进行干预,而非施加全局惩罚。代码在补充材料中提供。
引用
@article{arxiv.2604.03045,
title = {STEAR: Layer-Aware Spatiotemporal Evidence Intervention for Hallucination Mitigation in Video Large Language Models},
author = {Linfeng Fan and Yuan Tian and Ziwei Li and Zhiwu Lu},
journal= {arXiv preprint arXiv:2604.03045},
year = {2026}
}
备注
Preprint