凭借草稿进行思考:高效长视频理解的预测性时序推理
计算机视觉与模式识别
2026-03-02 v2
摘要
长视频理解是实现类人智能的关键,使能够对扩展的时序上下文进行连贯的感知与推理。虽然新兴的以帧为基础的思考范式——在全局时序推理和局部帧检查之间交替——已推进视频多模态大语言模型 (MLLM) 的推理能力,但由于逐渐增长和冗余的多模态上下文,其效率存在显著瓶颈。为此,我们提出了基于强化学习的 SpecTemp——一种解耦时序感知与推理的预测性时序推理框架。在 SpecTemp 中,轻量级草稿 MLLM 快速探索和提出密集采样时序区域中突出的帧,而强大的目标 MLLM 则专注于时序推理并验证草稿的提议,不断细化注意力直至收敛。这种设计镜像了人类大脑的协作路径,实现了效率与准确性之间的平衡。为支持训练,我们构建了 SpecTemp-80K 数据集,包含粗糙证据跨度和细粒度帧级证据的同步双层标注。在多个视频理解基准测试中进行的实验表明,SpecTemp 不仅保持了有竞争力的准确性,而且在与现有以帧为基础的思考方法相比时显著加快了推理速度。
引用
@article{arxiv.2512.00805,
title = {Thinking with Drafts: Speculative Temporal Reasoning for Efficient Long Video Understanding},
author = {Pengfei Hu and Meng Cao and Yingyao Wang and Yi Wang and Jiahua Dong and Jun Song and Yu Cheng and Bo Zheng and Xiaodan Liang},
journal= {arXiv preprint arXiv:2512.00805},
year = {2026}
}
备注
Accepted by CVPR 26