何时发生?基于时长信息的视频博客中叙述动作的时间定位
计算机视觉与模式识别
2022-02-22 v2 计算与语言
摘要
我们考虑生活方式视频博客中的时间性人体动作定位任务。我们引入了一个新颖的数据集,包含对 1,200 个视频片段中 13,000 个叙述动作的手动时间定位标注。我们对该数据进行了广泛分析,使我们能更好地理解语言和视觉模态在整个视频中如何交互。我们提出了一种简单而有效的方法,基于叙述动作的预期时长来定位它们。通过若干实验与分析,我们表明我们的方法相对于先前方法带来了互补信息,并改进了先前工作在时间动作定位任务上的表现。
引用
@article{arxiv.2202.08138,
title = {When Did It Happen? Duration-informed Temporal Localization of Narrated Actions in Vlogs},
author = {Oana Ignat and Santiago Castro and Yuhang Zhou and Jiajun Bao and Dandan Shan and Rada Mihalcea},
journal= {arXiv preprint arXiv:2202.08138},
year = {2022}
}
备注
arXiv admin note: text overlap with arXiv:1906.04236