中文

面向三维卷积网络视频重定向的无监督动作定位裁剪

计算机视觉与模式识别 2021-11-23 v2 机器学习 机器人学

摘要

社交媒体上的未修剪视频或机器人与监控摄像头捕获的视频具有多样的长宽比。然而,3D CNN 通常要求输入为方形视频,其空间维度小于原始视频。随机或中心裁剪可能完全遗漏视频主体。为此,我们提出一种无监督视频裁剪方法,将其建模为重定向与视频到视频合成问题。合成视频保持 1:1 长宽比,尺寸更小,并在整个时长内以视频主体为目标。首先,通过识别具有同质运动模式的块,在每帧上执行动作定位。从而每帧确定一个显著块。但为避免视点抖动与闪烁,块间的任何尺度或位置变化应随时间逐渐进行。该问题通过 3D 空间中的 polyBezier 拟合解决,该曲线穿过某些选定的枢轴时间戳,其形状受中间控制时间戳影响。为验证所提方法的有效性,我们在 UCF-101、HMDB-51 和 ActivityNet v1.3 三个基准数据集上通过比较我们的动态裁剪与随机裁剪来评估视频分类任务。经我们裁剪后用于视频分类的片段与 top-1 准确率,优于同等尺寸随机裁剪输入的 3D CNN 表现,也超越了一些更大尺寸的随机裁剪。

关键词

引用

@article{arxiv.2111.07426,
  title  = {Unsupervised Action Localization Crop in Video Retargeting for 3D ConvNets},
  author = {Prithwish Jana and Swarnabja Bhaumik and Partha Pratim Mohanta},
  journal= {arXiv preprint arXiv:2111.07426},
  year   = {2021}
}

备注

Accepted for Publication in Proceedings of 2021 IEEE Region 10 Conference (TENCON), 7-10 December 2021, Auckland, New Zealand