基于视觉 Transformer 的以人为中心时空视频定位
计算机视觉与模式识别
2021-06-03 v2 人工智能
多媒体
摘要
本文中,我们引入一项新任务——以人为中心的时空视频定位(HC-STVG)。不同于图像或视频中已有的指称表达任务,HC-STVG 通过聚焦于人,旨在基于给定文本描述从未经裁剪的视频中定位目标人物的时空管。该任务尤为有用,特别是在医疗与安全相关应用中,其中监控视频可能极长而仅关注特定时段内的特定人物。HC-STVG 是一项同时要求空间(何处)与时间(何时)定位的视频定位任务。遗憾的是,现有定位方法不能很好处理该任务。我们通过提出一种名为基于视觉 Transformer 的时空定位(STGVT)的有效基线方法来解决此任务,其利用 Visual Transformers 提取用于视频-句子匹配与时间定位的跨模态表示。为推进此任务,我们还贡献了一个 HC-STVG 数据集,包含复杂多人场景下的 5660 个视频-句子对。具体而言,每个视频时长 20 秒,配对一句平均 17.25 词的自然查询句。在该数据集上进行了充分实验,表明新提方法优于现有基线方法。
引用
@article{arxiv.2011.05049,
title = {Human-centric Spatio-Temporal Video Grounding With Visual Transformers},
author = {Zongheng Tang and Yue Liao and Si Liu and Guanbin Li and Xiaojie Jin and Hongxu Jiang and Qian Yu and Dong Xu},
journal= {arXiv preprint arXiv:2011.05049},
year = {2021}
}
备注
Accept at TCSVT