SmartSight:通过时间注意力塌陷缓解视频-LLM幻觉而不损害视频理解
计算机视觉与模式识别
2025-12-23 v1
摘要
尽管视频大型语言模型(Video-LLM)近年来迅速进步,但感知幻觉仍是一个巨大的安全风险,这严重限制了其实际应用。虽然已提出多种幻觉缓解方法,但往往会损害模型的视频理解和推理能力。在本工作中,我们提出了SmartSight,这是首个在训练-free方式下解决此问题的方法,利用模型自身的内省能力。具体而言,SmartSight生成多个候选响应,以揭示被标准贪婪解码所掩盖的低幻觉输出。它使用时间注意力塌陷得分来评估每个响应的幻觉程度,该得分衡量模型在生成响应时是否过度聚焦于输入视频的平凡时序区域。为提高效率,SmartSight识别视觉注意力消失点,实现更精确的幻觉估计和幻觉响应的提前终止,从而显著减少解码成本。实验表明,SmartSight在VRIPT-HAL上将Qwen2.5-VL-7B的幻觉降低了10.59%,同时提升了视频理解和推理能力,在VideoMMMU上性能提升最高可达8.86%。这些结果凸显了SmartSight在提高开源Video-LLM可靠性方面的有效性。
引用
@article{arxiv.2512.18671,
title = {SmartSight: Mitigating Hallucination in Video-LLMs Without Compromising Video Understanding via Temporal Attention Collapse},
author = {Yiming Sun and Mi Zhang and Feifei Li and Geng Hong and Min Yang},
journal= {arXiv preprint arXiv:2512.18671},
year = {2025}
}
备注
AAAI26 accepted