LongVideo-R1:面向低成本长视频理解的智能导航
计算机视觉与模式识别
2026-04-16 v2
摘要
本文解决了在低计算预算下进行长视频理解这一关键且鲜有人关注的挑战。我们提出了 LongVideo-R1,一个具有主动推理能力的多模态大语言模型 (MLLM) 智能体,专为高效视频上下文导航而设计,避免冗余的穷举搜索。LongVideo-R1 的核心在于一个推理模块,利用高层次视觉线索推断最具信息性的视频片段以供后续处理。在推理过程中,该智能体从顶层视觉摘要开始遍历,并迭代细化其关注重点,一旦获取足够知识即可立即停止探索过程。为便于训练,我们首先从 CGBench 提取层次化视频字幕,该数据集包含 grounding 标注。随后指导 GPT-5 生成 33K 条高质量的链式思考-工具轨迹。LongVideo-R1 智能体在经过监督微调 (SFT) 后,再经强化学习 (RL) 微调,RL 采用专为最大化选择性高效剪辑导航而设计的奖励函数。多项长视频基准测试的实验结果表明,name 方法在准确率与效率之间实现了优越的权衡。所有精选数据和源代码均提供于补充材料中,并将公开发布。代码和数据可在 https://github.com/qiujihao19/LongVideo-R1 获取。
引用
@article{arxiv.2602.20913,
title = {LongVideo-R1: Smart Navigation for Low-cost Long Video Understanding},
author = {Jihao Qiu and Lingxi Xie and Xinyue Huo and Qi Tian and Qixiang Ye},
journal= {arXiv preprint arXiv:2602.20913},
year = {2026}
}
备注
17 pages, 9 figures, 8 tables, accepted to CVPR 2026