中文

扭曲或制造?视频大语言模型中的幻觉综述

计算机视觉与模式识别 2026-04-15 v1

摘要

尽管在视频语言建模方面取得了显著进展,但幻觉(hallucination)仍是视频大语言模型(Video Large Language Models, Vid-LLMs)中的持久挑战,指的是输出看似合理却与输入视频内容矛盾的现象。本综述对Vid-LLMs中的幻觉进行了全面分析,提出了系统性的分类框架,将其分为两大核心类型:动态失真(dynamic distortion)和内容虚构(content fabrication),每种类型又包含两个亚类型。基于这一分类,我们回顾了近期在幻觉评估与缓解方面的最新进展,涵盖关键基准、指标和干预策略。我们进一步分析了动态失真和内容虚构的根本原因,通常源于对时间表示容量的有限和视觉 grounding 的不足。这些见解为未来工作的多个有前景的方向提供了启发,包括开发感知运动的视觉编码器和整合反事实学习技术。本综述汇聚了零散的研究进展,为建立稳健可靠的视频语言系统奠定了基础。我们维护了一个最新整理的相关工作列表,地址为 https://github.com/hukcc/Awesome-Video-Hallucination。

关键词

引用

@article{arxiv.2604.13028,
  title  = {Conflated Inverse Modeling to Generate Diverse and Temperature-Change Inducing Urban Vegetation Patterns},
  author = {Baris Sarper Tezcan and Hrishikesh Viswanath and Rubab Saher and Daniel Aliaga},
  journal= {arXiv preprint arXiv:2604.13028},
  year   = {2026}
}

备注

Accepted to the CVPR 2026 EarthVision Workshop