中文

什么、何时、何地?——基于旁白指令在未裁剪多动作视频中的自监督时空定位

计算机视觉与模式识别 2024-05-30 v2

摘要

时空定位描述了仅基于语言描述在时空(如视频数据)中定位事件的任务。该任务的模型通常使用人工标注的句子与边界框监督进行训练。本工作从多模态监督视角解决此任务,提出一种仅以松散视频与字幕监督训练、无需人工标注的时空动作定位框架。为此,我们将聚焦于利用细粒度空间信息的局部表示学习与捕获更高层表示的全局表示编码相结合,并纳入统一联合方法。为在真实场景中评估这一具挑战性的任务,我们提出了一个新的基准数据集,其在长时长、未裁剪、多动作教学视频中为超过 5K 个事件提供了密集时空定位标注。我们在提出的数据集与标准下游任务上评估了所提方法与其他方法,表明我们的方法在包括空间、时间以及未裁剪多动作时空定位在内的多种设定中均优于当前基线。

关键词

引用

@article{arxiv.2303.16990,
  title  = {What, when, and where? -- Self-Supervised Spatio-Temporal Grounding in Untrimmed Multi-Action Videos from Narrated Instructions},
  author = {Brian Chen and Nina Shvetsova and Andrew Rouditchenko and Daniel Kondermann and Samuel Thomas and Shih-Fu Chang and Rogerio Feris and James Glass and Hilde Kuehne},
  journal= {arXiv preprint arXiv:2303.16990},
  year   = {2024}
}

备注

To be presented at CVPR 2024. Project page: https://brian7685.github.io/STG/