基于高斯核的跨模态网络用于时空视频定位
计算机视觉与模式识别
2022-07-05 v1
摘要
时空视频定位(STVG)是一项具有挑战性的任务,旨在根据自然语言查询在语义上定位感兴趣对象的时空管。大多数先前的工作不仅严重依赖于 Faster R-CNN 提取的锚框,而且简单地将视频视为一系列独立的帧,从而缺乏时间建模。相反,本文首次提出了一个用于 STVG 的无锚框框架,称为基于高斯核的跨模态网络(GKCMN)。具体而言,我们利用每帧学习到的基于高斯核的热力图来定位与查询相关的对象。进一步开发了一种串行与并行混合连接网络,以利用帧间的空间和时间关系来实现更好的定位。在 VidSTG 数据集上的实验结果证明了我们提出的 GKCMN 的有效性。
引用
@article{arxiv.2207.00744,
title = {Gaussian Kernel-based Cross Modal Network for Spatio-Temporal Video Grounding},
author = {Zeyu Xiong and Daizong Liu and Pan Zhou},
journal= {arXiv preprint arXiv:2207.00744},
year = {2022}
}
备注
Accepted by ICIP2022