线索重要性:利用潜在视觉线索提升视频推理
计算机视觉与模式识别
2026-03-17 v1
摘要
多模态大语言模型(MLLM)已显著推进视频推理,但视频问答(VideoQA)仍面临时序因果推理和证据导向答案生成的挑战。主流的端到端MLLM框架缺乏视觉感知与答案推导之间显式的结构化推理,导致严重的幻觉现象和解释力差强。现有方法也未能解决三个核心问题:忠实的视觉线索提取、效用导向的线索过滤以及线索-答案的端到端对齐。灵感来自层次化的人类视觉认知,我们提出ClueNet,一个具备线索感知的视频推理框架,采用两阶段监督微调范式,无需大幅修改底层模型。解耦监督对齐线索提取与链式推理,推理监督配合自适应线索过滤器优化高阶推理,同时包含轻量级模块以实现高效推理。在NExT-QA、STAR和MVBench上的实验表明,ClueNet超越最新方法至少1.1%,并在泛化性、幻觉抑制、推理效率和跨骨架兼容性方面表现优异。该工作弥合了MLLM视频理解中的感知-生成鸿沟,为高风险视频问答应用提供可解释、可靠的推理范式。
引用
@article{arxiv.2603.15008,
title = {Clue Matters: Leveraging Latent Visual Clues to Empower Video Reasoning},
author = {Kaixin zhang and Xiaohe Li and Jiahao Li and Haohua Wu and Xinyu Zhao and Zide Fan and Lei Wang},
journal= {arXiv preprint arXiv:2603.15008},
year = {2026}
}
备注
18 pages, 7 figures