中文

何时发生?基于时长信息的视频博客中叙述动作的时间定位

计算机视觉与模式识别 2022-02-22 v2 计算与语言

摘要

我们考虑生活方式视频博客中的时间性人体动作定位任务。我们引入了一个新颖的数据集,包含对 1,200 个视频片段中 13,000 个叙述动作的手动时间定位标注。我们对该数据进行了广泛分析,使我们能更好地理解语言和视觉模态在整个视频中如何交互。我们提出了一种简单而有效的方法,基于叙述动作的预期时长来定位它们。通过若干实验与分析,我们表明我们的方法相对于先前方法带来了互补信息,并改进了先前工作在时间动作定位任务上的表现。

关键词

引用

@article{arxiv.2202.08138,
  title  = {When Did It Happen? Duration-informed Temporal Localization of Narrated Actions in Vlogs},
  author = {Oana Ignat and Santiago Castro and Yuhang Zhou and Jiajun Bao and Dandan Shan and Rada Mihalcea},
  journal= {arXiv preprint arXiv:2202.08138},
  year   = {2022}
}

备注

arXiv admin note: text overlap with arXiv:1906.04236