中文

TAG:一种用于零样本视频时间定位的简单而有效的时间感知方法

计算机视觉与模式识别 2025-08-12 v1

摘要

视频时间定位(VTG)旨在根据给定的自然语言查询提取相关的视频片段。近来,零样本VTG方法通过利用预训练的视觉-语言模型(VLM)来定位目标时刻而无需额外训练,引起了广泛关注。然而,现有方法存在语义碎片化问题,即共享相同语义的时间连续帧被分割到多个片段中。当片段碎片化时,难以预测与文本查询对齐的准确目标时刻。此外,它们依赖于偏斜的相似度分布进行定位,使得选择最优片段变得困难。而且,它们严重依赖大语言模型(LLM),这需要昂贵的推理成本。为解决这些局限性,我们提出了TAG,一种用于零样本视频时间定位的简单而有效的时间感知方法,该方法融合了时间池化、时间相干性聚类和相似度调整。我们提出的方法无需训练即可有效捕捉视频的时间上下文并解决相似度分布失真问题。我们的方法在Charades-STA和ActivityNet Captions基准数据集上取得了最先进的结果,且不依赖大语言模型。代码已开源:https://github.com/Nuetee/TAG。

关键词

引用

@article{arxiv.2508.07925,
  title  = {TAG: A Simple Yet Effective Temporal-Aware Approach for Zero-Shot Video Temporal Grounding},
  author = {Jin-Seop Lee and SungJoon Lee and Jaehan Ahn and YunSeok Choi and Jee-Hyong Lee},
  journal= {arXiv preprint arXiv:2508.07925},
  year   = {2025}
}