第一人称视频中的单阶段视觉查询定位
计算机视觉与模式识别
2023-06-16 v1
摘要
长时段第一人称视频上的视觉查询定位需要对视觉指定对象进行时空搜索与定位,对构建情景记忆系统至关重要。先前工作开发了复杂的多阶段流水线,利用成熟的物体检测与跟踪方法来执行VQL。然而,每个阶段独立训练,且流水线的复杂性导致推理速度缓慢。我们提出VQLoC,一种新颖的可端到端训练的单阶段VQL框架。我们的核心思想是首先建立查询与视频关系的整体理解,然后以一次性方式执行时空定位。具体而言,我们通过联合考虑查询与每个视频帧之间的查询到帧对应关系,以及相邻视频帧之间的帧到帧对应关系,来建立查询-视频关系。我们的实验表明,该方法在准确率上比先前的VQL方法高出20%,同时推理速度提升10倍。VQLoC也是Ego4D VQ2D挑战赛排行榜上的第一名。项目页面:https://hwjiang1510.github.io/VQLoC/
引用
@article{arxiv.2306.09324,
title = {Single-Stage Visual Query Localization in Egocentric Videos},
author = {Hanwen Jiang and Santhosh Kumar Ramakrishnan and Kristen Grauman},
journal= {arXiv preprint arXiv:2306.09324},
year = {2023}
}
备注
Winner of Ego4D VQ2D challenge 2023