中文

视频内循环:基于跨越校准的长视频问答

计算机视觉与模式识别 2025-10-09 v3

摘要

我们提出了 Video-in-the-Loop(ViTL),一个两阶段的长视频问答框架,通过首先以低帧率快速浏览以\emph{localize}问题相关区间,然后\emph{answer}通过跨越感知的视觉标记重新分配于更高有效帧率,输出交叉式结果,包含区间和最终选项以便直接归因。我们还引入了\dataname{},将基于描述的事件图转换为\emph{span-grounded}的多选问答,通过将每个问题配对\emph{ground-truth}时间区间和相关推理来实现。ViTL 使用包含区间定位与答案正确性的交叉式组相对目标进行端到端训练,允许答案信号反向流动到区间,而不会增加计算量。在固定标记预算下,ViTL 在长视频问答和时间定位任务(如 Charades-STA、ActivityNet-Captions)上以 50% 更少的帧输入实现最高提升 8.6%,且消融实验表明跨越感知的标记重新分配始终优于均匀抽样。

引用

@article{arxiv.2510.04022,
  title  = {Video-in-the-Loop: Span-Grounded Long Video QA with Interleaved Reasoning},
  author = {Chendong Wang and Donglin Bai and Yifan Yang and Xiao Jin and Anlan Zhang and Rui Wang and Shiqi Jiang and Yuqing Yang and Hao Wu and Qi Dai and Chong Luo and Ting Cao and Lili Qiu and Suman Banerjee},
  journal= {arXiv preprint arXiv:2510.04022},
  year   = {2025}
}