中文

通过来自网页图像的域迁移实现视频中细粒度动作的时间定位

计算机视觉与模式识别 2015-08-05 v2 多媒体

摘要

我们研究了从未修剪的网页视频中进行细粒度动作定位的问题。我们假设训练时仅能获得弱的视频级标注。目标是利用这些弱标签识别对应于动作的时间片段,并学习能泛化到无约束网页视频的模型。我们发现,通过动作名称查询获得的网页图像可作为许多动作定位良好的高亮片段,但其标签存在噪声。为解决这一问题,我们提出了一种简单而有效的方法,以弱视频标签和噪声图像标签为输入,生成定位后的动作帧。这是通过利用预训练的深卷积神经网络,在视频帧和网页图像之间进行跨域迁移实现的。随后,我们利用定位后的动作帧,结合长短期记忆网络训练动作识别模型。我们收集了一个包含超过 130,000 个 YouTube 视频的细粒度体育动作数据集 FGA-240,涵盖 85 项体育活动中的 240 种细粒度动作。在 FGA-240 数据集以及包含未修剪训练视频的 THUMOS 2014 定位数据集上均展示了令人信服的结果。

关键词

引用

@article{arxiv.1504.00983,
  title  = {Temporal Localization of Fine-Grained Actions in Videos by Domain Transfer from Web Images},
  author = {Chen Sun and Sanketh Shetty and Rahul Sukthankar and Ram Nevatia},
  journal= {arXiv preprint arXiv:1504.00983},
  year   = {2015}
}

备注

Camera ready version for ACM Multimedia 2015