Video-MTR:面向长视频理解的强化多轮推理
计算机视觉与模式识别
2025-08-29 v1
摘要
长视频理解具有长程时间依赖和多重事件的特征,仍然是一个挑战。现有方法通常依赖静态推理或外部视觉语言模型,由于缺乏端到端训练,面临复杂性和次优性能等问题。在本文中,我们提出了Video-MTR,一种强化多轮推理框架,旨在实现迭代的关键视频片段选择和问题理解。不同于在单轮中生成预测的传统视频推理流程,Video-MTR在多轮中进行推理,基于对先前处理片段的不断深入理解和当前问题,逐步选择视频片段。这种迭代过程允许对视频进行更精细且具备上下文感知的分析。为确保中间推理过程,我们引入了一种新颖的门控双层奖励系统,结合了基于答案正确性的轨迹级奖励和强调帧-查询相关性的轮次级奖励。该系统同时优化了视频片段选择和问题理解,消除了对外部视觉语言模型的需求并允许端到端训练。在VideoMME、MLVU和EgoSchema等基准上的大量实验表明,Video-MTR在准确性和效率上均优于现有方法,推进了长视频理解领域的SOTA。
引用
@article{arxiv.2508.20478,
title = {Video-MTR: Reinforced Multi-Turn Reasoning for Long Video Understanding},
author = {Yuan Xie and Tianshui Chen and Zheng Ge and Lionel Ni},
journal= {arXiv preprint arXiv:2508.20478},
year = {2025}
}
备注
15 pages, 9 figures