基于静态和动态图对齐网络的时序视频定位
计算机视觉与模式识别
2026-05-04 v1
摘要
时序视频定位(TVG)旨在在未裁剪的视频中定位与给定自然语言查询语义对应的时序时刻。最近,图卷积网络(GCN)在TVG中广泛采用,用于建模视频片段之间的时序关系,通过构建片段级别图来增强情境推理。尽管其有效性,现有GCN-based TVG方法仍面临三个关键瓶颈:1)大多数方法仅使用静态或动态特征构建图节点,导致视觉表征不完整,忽略互补语义;2)大多数方法以查询不可感知的方式构建时序图,导致时序图表示中的特征交互效率低下;3)大多数方法常因单一粒度语义匹配而受限,直接在复杂时序定位任务上训练可能导致收敛缓慢和次优精度。为解决这些挑战,本文提出Static和Dynamic图对齐网络(SDGAN)。首先,SDGAN联合利用静态和动态视觉特征构建两个互补时序图,并执行基于位置的节点对齐,实现更具表达力和鲁棒性的视觉表征。其次,SDGAN引入查询-片段对比学习和自适应图建模,显式对齐视觉片段与其对应的文本查询,生成查询感知的视觉表征。最后,SDGAN在渐进式易到难训练策略中融入多粒度时序提案,有效桥接粗粒度语义定位与细粒度时序边界细化。广泛的实验在三个基准数据集上表明,SDGAN在复杂TVG场景中实现了卓越的性能。代码和数据集均可用于https://github.com/ZhanJieHu/SDGAN。
引用
@article{arxiv.2605.00684,
title = {Static and Dynamic Graph Alignment Network for Temporal Video Grounding},
author = {Zhanjie Hu and Bolin Zhang and Jianhua Wang and Jianbo Zheng and Chenchen Yan and Takahiro Komamizu and Ichiro Ide and Jiangbo Qian},
journal= {arXiv preprint arXiv:2605.00684},
year = {2026}
}