驯服幻觉:通过反事实视频生成提升 MLLM 的视频理解
计算机视觉与模式识别
2026-01-01 v1 人工智能
摘要
多模态大型语言模型 (MLLM) 在视频理解方面取得了显著进展。然而,他们面临一个关键漏洞:过度依赖语言先验,尤其在处理反事实视频时,容易产生视觉无依托幻觉。这一局限性源于文本与视频之间数据不平衡,因而难以通过收集和标注反事实数据来缓解。为此,我们提出了 DualityForge——一种新型反事实数据合成框架,采用可控的扩散基于视频编辑将真实视频转化为反事实情景。通过将结构化情境信息嵌入视频编辑和问答生成过程中,该框架自动产生高质量的问答对,并伴随原始-编辑视频对,用于对比训练。基于此,我们构建了 DualityVidQA——一个大规模视频数据集,以降低 MLLM 的幻觉现象。此外,为充分利用配对数据的对比特性,我们提出了 Duality-Normalized Advantage Training (DNA-Train),这是一种两阶段 SFT-RL 训练方案,其中 RL 阶段采用成对的 优势归一化,从而实现更稳定和更高效的策略优化。在 DualityVidQA-Test 上的实验表明,我们的方法在反事实视频上显著降低了模型幻觉现象,相较于 Qwen2.5-VL-7B baseline 实现了约 24.0% 的相对提升。此外,我们的方法在幻觉和通用基准测试中均取得显著 gains,表明其具备强大的泛化能力。我们将公开数据集和代码。
引用
@article{arxiv.2512.24271,
title = {Taming Hallucinations: Boosting MLLMs' Video Understanding via Counterfactual Video Generation},
author = {Zhe Huang and Hao Wen and Aiming Hao and Bingze Song and Meiqi Wu and Jiahong Wu and Xiangxiang Chu and Sheng Lu and Haoqian Wang},
journal= {arXiv preprint arXiv:2512.24271},
year = {2026}
}
备注
18 pages