中文

VideoHEDGE: 基于语义聚类与时空扰动的视频 VLM 幻觉检测

计算机视觉与模式识别 2026-01-14 v1 人工智能

摘要

具备视频处理能力的视觉语言模型 (Video-VLM) 中的幻觉现象依然频繁且具有高置信度,而现有的不确定性指标往往无法与正确性对齐。我们引入了 VideoHEDGE,这是一个用于视频问答幻觉检测的模块化框架,它将基于熵的可靠性估计从图像扩展到了具有时间结构的输入。给定一个视频-问题对,VideoHEDGE 从干净片段以及光度与时空扰动变体中提取一个基线答案和多个高温生成结果,随后使用基于自然语言推理 (NLI) 或基于嵌入的方法,将生成的文本输出聚类为语义假设。聚类级别的概率质量产生三个可靠性分数:语义熵 (SE)、RadFlag 和视觉放大语义熵 (VASE)。我们在 SoccerChat 基准上使用 LLM-as-a-judge 评估 VideoHEDGE,以获取二元幻觉标签。在三个 7B Video-VLM (Qwen2-VL、Qwen2.5-VL 和一个 SoccerChat 微调模型) 上,VASE 始终取得最高的 ROC-AUC,尤其是在更大的失真预算下,而 SE 和 RadFlag 的表现往往接近随机水平。我们进一步表明,基于嵌入的聚类在检测性能上与基于 NLI 的聚类相当,但计算成本大幅降低;并且领域微调降低了幻觉频率,但仅带来校准方面的微小改善。hedge-bench PyPI 库支持可复现且可扩展的基准测试,完整代码与实验资源可在 https://github.com/Simula/HEDGE#videohedge 获取。

关键词

引用

@article{arxiv.2601.08557,
  title  = {VideoHEDGE: Entropy-Based Hallucination Detection for Video-VLMs via Semantic Clustering and Spatiotemporal Perturbations},
  author = {Sushant Gautam and Cise Midoglu and Vajira Thambawita and Michael A. Riegler and Pål Halvorsen},
  journal= {arXiv preprint arXiv:2601.08557},
  year   = {2026}
}