用于视频时间定位的关联引导查询依赖校准
计算机视觉与模式识别
2024-07-08 v4
摘要
时间定位旨在从视频中识别与文本描述对应的特定片段或高光时刻。时间定位中的典型方法在编码过程中平等对待所有视频片段,而不顾其与文本查询的语义相关性。因此,我们提出关联引导检测Transformer(CG-DETR),探索在跨模态注意力中为查询关联的视频片段提供线索。首先,我们设计了一种带伪令牌的自适应交叉注意力。由文本查询调节的伪令牌占据部分注意力权重,防止不相关视频片段被文本查询表示。然而,并非所有词都同等继承文本查询与视频片段的相关性。因此,我们通过推断视频片段与词之间的细粒度相关性进一步引导交叉注意力图。我们通过学习高层概念(即片段与句子层级)的联合嵌入空间并推断片段-词相关性来实现这一点。最后,我们利用片段特定特征并将其与每个视频的上下文结合,形成片段自适应显著性检测器。通过利用每个视频片段中文本参与的程度,其精确度量各片段的高光性。CG-DETR在各种时间定位基准上取得了最先进(SOTA)结果。代码见 https://github.com/wjun0830/CGDETR。
引用
@article{arxiv.2311.08835,
title = {Correlation-Guided Query-Dependency Calibration for Video Temporal Grounding},
author = {WonJun Moon and Sangeek Hyun and SuBeen Lee and Jae-Pil Heo},
journal= {arXiv preprint arXiv:2311.08835},
year = {2024}
}
备注
29 pages, 15 figures, 14 tables, Code is available at https://github.com/wjun0830/CGDETR