中文

HieraMamba:基于层次锚框-Mamba池化的视频时序 grounding

计算机视觉与模式识别 2026-04-01 v2

摘要

视频时序 grounding 是在未裁剪视频中定位自然语言查询起始和结束时间的任务,需要捕获全局上下文和细粒度时序细节。这种挑战在长视频中尤为突出,现有方法常通过过度下采样或依赖固定窗口而妥协时序保真度。我们提出HieraMamba,一种层次化架构,跨尺度保留时序结构和语义丰富性。其核心是锚框-Mamba池化(AMP)模块,利用Mamba的选择性扫描生成多个粒度的紧凑锚框标记。两种互补目标——锚框条件和片段池化对比损失——鼓励锚框保留局部细节同时保持全局判别性。HieraMamba 在 Ego4D-NLQ、MAD 和 TACoS 上实现了新的最先进成绩,展示了在长篇未裁剪视频中实现精确、时序忠实的定位。

关键词

引用

@article{arxiv.2510.23043,
  title  = {HieraMamba: Video Temporal Grounding via Hierarchical Anchor-Mamba Pooling},
  author = {Joungbin An and Kristen Grauman},
  journal= {arXiv preprint arXiv:2510.23043},
  year   = {2026}
}

备注

CVPR 2026. Project Page: https://vision.cs.utexas.edu/projects/hieramamba/