HieraMamba:基于层次锚框-Mamba池化的视频时序 grounding
计算机视觉与模式识别
2026-04-01 v2
摘要
视频时序 grounding 是在未裁剪视频中定位自然语言查询起始和结束时间的任务,需要捕获全局上下文和细粒度时序细节。这种挑战在长视频中尤为突出,现有方法常通过过度下采样或依赖固定窗口而妥协时序保真度。我们提出HieraMamba,一种层次化架构,跨尺度保留时序结构和语义丰富性。其核心是锚框-Mamba池化(AMP)模块,利用Mamba的选择性扫描生成多个粒度的紧凑锚框标记。两种互补目标——锚框条件和片段池化对比损失——鼓励锚框保留局部细节同时保持全局判别性。HieraMamba 在 Ego4D-NLQ、MAD 和 TACoS 上实现了新的最先进成绩,展示了在长篇未裁剪视频中实现精确、时序忠实的定位。
引用
@article{arxiv.2510.23043,
title = {HieraMamba: Video Temporal Grounding via Hierarchical Anchor-Mamba Pooling},
author = {Joungbin An and Kristen Grauman},
journal= {arXiv preprint arXiv:2510.23043},
year = {2026}
}
备注
CVPR 2026. Project Page: https://vision.cs.utexas.edu/projects/hieramamba/