VidHalluc:评估多模态大语言模型在视频理解中的时间幻觉
计算机视觉与模式识别
2025-04-02 v2
摘要
多模态大语言模型(MLLMs)最近在视频理解方面取得了显著进展,在内容推理和指令遵循任务中表现出色。然而,模型生成不准确或误导性内容的幻觉现象在视频领域仍未得到充分探索。基于MLLM视觉编码器通常难以区分视觉上不同但语义上相似的视频对这一观察,我们引入了VidHalluc,这是目前最大的用于检查MLLMs在视频理解中幻觉的基准。它包含5,002个视频,这些视频被配对以突出容易产生幻觉的情况。VidHalluc从三个关键维度评估幻觉:(1)动作,(2)时间序列,以及(3)场景转换。全面测试表明,大多数MLLMs在这些维度上都容易产生幻觉。此外,我们提出了DINO-HEAL,一种无需训练的方法,通过在推理过程中引入来自DINOv2的空间显著性来重新加权视觉特征,从而减少幻觉。我们的结果表明,DINO-HEAL在VidHalluc上持续提升了性能,在所有任务中平均减少了3.02%的幻觉。VidHalluc基准和DINO-HEAL代码均可在https://people-robots.github.io/vidhalluc获取。
引用
@article{arxiv.2412.03735,
title = {VidHalluc: Evaluating Temporal Hallucinations in Multimodal Large Language Models for Video Understanding},
author = {Chaoyu Li and Eun Woo Im and Pooyan Fazli},
journal= {arXiv preprint arXiv:2412.03735},
year = {2025}
}
备注
CVPR 2025