中文

基于显式证据 grounding 的视频证据到推理高效视频理解

计算机视觉与模式识别 2026-01-13 v1

摘要

大型视觉语言模型 (LVLMs) 在视频推理中面临一个根本性困境:它们在繁复推理的计算成本与高效无依据方法的幻觉风险之间受到制约。为解决这一问题,我们引入证据链 (CoE),一个新型框架,通过架构性地解耦感知 grounding 与推理效率,实现联合优化。CoE 包含两个核心创新:(1) 一个轻量级证据 grounding 模块 (EGM),作为查询引导的滤波器,动态识别并提取一组紧凑的高保真视觉证据;(2) 基于强化学习优化的证据锚定协议。关键在于,我们设计了复合奖励机制,以强制过程对齐,迫使模型在推理时严格引用已识别的时间锚点,从而缓解幻觉问题。为实现这一目标,我们构建了 CoE-Instruct 数据集(包含 164k 个样本),采用新颖的双重标注模式实现感知与推理的独立监督。广泛的实验在五个基准测试上(包括 Video-MME、MVBench 和 VSI-Bench),表明 CoE 增强模型建立了新的状态最佳成绩。它们在准确率上显著优于现有方法,证明 CoE 是一个强大且实用的可靠视频理解范式。

关键词

引用

@article{arxiv.2601.07761,
  title  = {Video Evidence to Reasoning Efficient Video Understanding via Explicit Evidence Grounding},
  author = {Yanxiang Huang and Guohua Gao and Zhaoyang Wei and Jianyuan Ni},
  journal= {arXiv preprint arXiv:2601.07761},
  year   = {2026}
}

备注

6 pages