中文

放宽锚框帧主导,缓解视频大语言模型中的幻觉

计算机视觉与模式识别 2026-04-15 v1

摘要

最近的视频大语言模型(Video-LLMs)在视频理解方面展现出强大的能力,但仍然存在幻觉问题。现有的缓解方法通常依赖于训练、输入修改、辅助引导或额外的解码程序,而基本上忽略了更根本的挑战。在生成过程中,视频大语言模型倾向于过度依赖于时间证据的有限部分,导致视频中证据聚合在时段上不均衡。为解决此问题,我们研究了解码器侧现象,即模型表现出时段不均衡的集中模式。我们将聚合帧级注意力质量最高的帧称为锚框帧。我们发现,这种偏差基本上独立于输入视频,反而反映出一种持久的、模型特定的结构或位置偏差,其过度主导与幻觉-prone 生成密切相关。鼓励这一洞察,我们提出了解码器侧时段平衡(Decoder-side Temporal Rebalancing, DTR)方法,这是一种无训练的、有层选择的推理方法,通过重新分配中间到晚期解码器层中的时段证据分配,而不改变视觉编码或需要辅助模型。DTR自适应地校准解码器侧的视觉注意力,以缓解时段不均衡的集中,并鼓励未被关注的帧更有效地参与响应生成。如此,DTR引导解码器在时段更广泛且更平衡的视频证据中进行 grounding。广泛的实验表明,DTR在各种Video-LLM家族中都能持续改善幻觉鲁棒性,同时保持竞争的视频理解性能和高效的推理效率。

关键词

引用

@article{arxiv.2604.12582,
  title  = {Relaxing Anchor-Frame Dominance for Mitigating Hallucinations in Video Large Language Models},
  author = {Zijian Liu and Sihan Cao and Pengcheng Zheng and Kuien Liu and Caiyan Qin and Xiaolin Qin and Jiwei Wei and Chaoning Zhang},
  journal= {arXiv preprint arXiv:2604.12582},
  year   = {2026}
}