中文

面向长时段视频语言理解的时序抽样策略优化 (TSPO)

计算机视觉与模式识别 2025-11-14 v4

摘要

多模态大语言模型(MLLMs)在视角语言任务中取得了显著进展,但在处理长时段视频输入时仍面临挑战。由于 MLLMs 的上下文限制和训练成本的限制,必须在将视频输入到 MLLMs 之前进行稀疏帧抽样。然而,由于视频 MLLMs 中稀疏帧抽样的非监督性和不可微性,构建可训练的抽样方法仍然具有挑战性。为此,我们提出时序抽样策略优化(TSPO),通过强化学习推进 MLLMs 的长时段视频语言理解。具体而言,我们首先提出一种可训练的事件感知时序智能体,通过捕获事件查询关联性进行概率性关键帧选择。然后,我们提出 TSPO 强化学习范式,将关键帧选择和语言生成建模为联合决策过程,实现时序抽样策略的端到端组相对优化。此外,我们提出一种双风格长视频训练数据构建管道,平衡全面时序理解和关键片段定位。最后,我们纳入基于规则的 answering accuracy 和时序定位奖励机制,以优化时序抽样策略。全面实验表明,我们的 TSPO 在多个长视频理解基准测试中实现了最先进的性能,并显示出在不同 cutting-edge Video-MLLMs 之间的可迁移能力。我们的代码已公开于 https://github.com/Hui-design/TSPO

关键词

引用

@article{arxiv.2508.04369,
  title  = {TSPO: Temporal Sampling Policy Optimization for Long-form Video Language Understanding},
  author = {Canhui Tang and Zifan Han and Hongbo Sun and Sanping Zhou and Xuchong Zhang and Xin Wei and Ye Yuan and Huayu Zhang and Jinglin Xu and Hao Sun},
  journal= {arXiv preprint arXiv:2508.04369},
  year   = {2025}
}

备注

Accepted by AAAI 2026