探索大型多模态模型在视频理解中的幻觉问题:基准测试、分析与缓解
计算机视觉与模式识别
2025-03-26 v1
摘要
大型多模态模型(LMM)的幻觉现象——即看似正确却实际错误的响应——限制了其可靠性和适用性。本文旨在研究 LMM 在视频模态中的幻觉问题,这种问题具有动态性且比静态模态(如图像和文本)更具挑战性。基于此动机,我们首先提出了名为 HAVEN 的综合基准测试,用于评估 LMM 在视频理解任务中的幻觉。该基准构建于三个维度上,即幻觉原因、幻觉方面和问题格式, resulting in 6K 问题。随后,我们通过对 16 个 LMM 的实验,对 7 个影响因素进行量化分析,如视频时长、模型规模和模型推理方式。此外,借鉴 OpenAI o1 等近期思考模型,我们提出了一种视频思考模型,通过监督推理微调(SRFT)和直接偏好优化(TDPO)来缓解 LMM 的幻觉问题——其中 SRFT 增强推理能力,而 TDPO 减少思考过程中的幻觉。大量实验和分析表明,该方法有效。显著的是,它在幻觉评估准确率上提升了 7.65%,偏差得分降低了 4.5%。代码和数据已公开于 https://github.com/Hongcheng-Gao/HAVEN。
引用
@article{arxiv.2503.19622,
title = {Exploring Hallucination of Large Multimodal Models in Video Understanding: Benchmark, Analysis and Mitigation},
author = {Hongcheng Gao and Jiashu Qu and Jingyi Tang and Baolong Bi and Yue Liu and Hongyu Chen and Li Liang and Li Su and Qingming Huang},
journal= {arXiv preprint arXiv:2503.19622},
year = {2025}
}