描述性时空视频检测
计算机视觉与模式识别
2024-07-09 v1
摘要
检测语言表达中的视觉内容已成为社区中的一个新兴主题。然而,在视频领域,现有的设置,即时空视频 grounding (STVG),仅用于检测每个帧中预先存在的一个对象,忽略了语言描述可能涉及视频中零个或多个实体的事实。本文通过克服上述限制,将 STVG 推进到一种更实用的设置,称为描述性时空视频检测 (DSTVD)。为促进 DSTVD 探索,我们首先引入了一个新的基准数据集,即 DVD-ST。值得注意的是,DVD-ST 支持从无到多个对象进行 grounding,以响应查询,并涵盖超过 150 种实体,包括外观、动作、位置和相互作用。DVD-ST 数据集的广泛覆盖范围和多样性使其成为 DSTVD 研究的优秀测试平台。除了新的基准数据集外,我们进一步提出了两种基线方法,用于我们提出的 DSTVD 任务,通过扩展两个代表性 STVG 模型(即 TubeDETR 和 STCAT)来实现。这些扩展模型利用 tubelet 查询在视频序列中对被指对象进行局部化和跟踪。此外,我们调整了这些模型的训练目标,以优化时空局部化精度和多类别分类能力。我们在所介绍的 DVD-ST 数据集上对基线方法进行基准测试,并进行大量实验分析,以指导未来研究。我们的代码和基准将对外公开。
引用
@article{arxiv.2407.05610,
title = {Described Spatial-Temporal Video Detection},
author = {Wei Ji and Xiangyan Liu and Yingfei Sun and Jiajun Deng and You Qin and Ammar Nuwanna and Mengyao Qiu and Lina Wei and Roger Zimmermann},
journal= {arXiv preprint arXiv:2407.05610},
year = {2024}
}