中文

在少量视频中定位共同动作

计算机视觉与模式识别 2020-08-26 v2 机器学习 图像与视频处理

摘要

本文致力于在一段长的未裁剪视频中定位动作的时间范围。现有工作利用训练时带有动作起始、结束和/或动作类别的大量示例,而我们提出少样本共同动作定位。长未裁剪视频中动作的起始与结束仅基于少量包含相同动作的已裁剪视频示例来确定,且无需知道其共同类别标签。为应对该任务,我们引入了一种新的 3D 卷积网络架构,能够将支持视频的表示与相关的查询视频片段对齐。该网络包含:(\textit{i}) 一个互增强模块,用于同时补充少量已裁剪支持视频与未裁剪查询视频的表示;(\textit{ii}) 一个渐进对齐模块,迭代地将支持视频融合进查询分支;以及 (\textit{iii}) 一个成对匹配模块,用于权衡不同支持视频的重要性。在包含单个或多个动作实例的未裁剪视频中进行少样本共同动作定位的评估,证明了我们方法的有效性与普遍适用性。

关键词

引用

@article{arxiv.2008.05826,
  title  = {Localizing the Common Action Among a Few Videos},
  author = {Pengwan Yang and Vincent Tao Hu and Pascal Mettes and Cees G. M. Snoek},
  journal= {arXiv preprint arXiv:2008.05826},
  year   = {2020}
}

备注

ECCV 2020