T2SGrid:视频时空网格化用于时空 grounding
计算机视觉与模式识别
2026-03-10 v1
摘要
视频时空 grounding(VTG)旨在定位与自然语言查询相对应的视频片段,这需要对复杂时序动态进行全面理解。现有的视觉大语言模型(Vision-LMM)通常通过位置编码、文本基准时间戳或视觉帧编号来感知时序动态。然而,这些方法存在显著局限:为每个帧分配文本基准时间戳令牌会引入额外计算开销并导致视觉注意力稀疏化,位置编码难以捕获绝对时序信息,视觉帧编号往往妥协空间细节。为解决这些问题,我们提出时序到时空网格化(T2SGrid),一个新框架,将视频时序理解重新表述为时空理解任务。T2SGrid 的核心思想是以片段而非单个帧处理视频内容。我们采用重叠滑动窗口机制将视频分割为时序片段。在每个窗口内,按时间顺序将帧排成行主序构成复合网格图像,从而将时序序列转化为结构化的 2D 布局。网格化不仅编码时序信息,还增强了每个网格内的局部注意力。此外,T2SGrid 允许使用复合文本时间戳建立全局时序意识。实验在标准 VTG 数据集上表明,T2SGrid 取得了优异的性能。
关键词
引用
@article{arxiv.2603.06973,
title = {T2SGrid: Temporal-to-Spatial Gridification for Video Temporal Grounding},
author = {Chaohong Guo and Yihan He and Yongwei Nie and Fei Ma and Xuemiao Xu and Chengjiang Long},
journal= {arXiv preprint arXiv:2603.06973},
year = {2026}
}