中文

SlowFocus:增强视频 LLM 中细粒度时序理解

计算机视觉与模式识别 2026-02-04 v1

摘要

大型语言模型 (LLM) 在文本理解方面展现出卓越能力,这为其扩展到视频 LLM (Vid-LLM) 以分析视频数据铺平了道路。然而,当前的 Vid-LLM 在同时保持高质量的帧级语义信息(即每帧足够多的 token)和完整的视频级时序信息(即每段视频足够多的采样帧)方面存在挑战。这种限制阻碍了 Vid-LLM 向细粒度视频理解的发展。为此,我们提出了 SlowFocus 机制,显著提升等效采样频率而不牺牲帧级视觉 token 的质量。SlowFocus 通过基于提出问题的查询识别相关时序片段,然后对该片段进行密集采样以提取局部高频特征。随后,利用多频率混合注意力模块将这些局部高频细节与全局低频上下文进行聚合,以实现更好的时序理解。此外,为使 Vid-LLM 适应这一创新机制,我们引入了一组训练策略,以增强时序定位和详细时序推理能力。进一步地,我们构建了 FineAction-CGR 基准,旨在评估 Vid-LLM 处理细粒度时序理解任务的能力。广泛的实验表明,我们的机制在现有公开视频理解基准以及我们提出的 FineAction-CGR 上均表现优异。

关键词

引用

@article{arxiv.2602.03589,
  title  = {SlowFocus: Enhancing Fine-grained Temporal Understanding in Video LLM},
  author = {Ming Nie and Dan Ding and Chunwei Wang and Yuanfan Guo and Jianhua Han and Hang Xu and Li Zhang},
  journal= {arXiv preprint arXiv:2602.03589},
  year   = {2026}
}

备注

NeurIPS 2024