中文

用于视频增强与动作识别的可学习采样三维卷积

计算机视觉与模式识别 2020-11-24 v1

摘要

视频增强与动作识别中的一个关键挑战是融合相邻帧中的有用信息。近期工作建议在融合时间信息之前,在相邻帧之间建立准确的对应关系。然而,生成的结果严重依赖于对应估计的质量。本文中,我们提出了一种更鲁棒的方案:对邻域帧间的多级特征进行采样与融合以生成结果。基于该思想,我们引入了一个新的模块来提升三维卷积的能力,即可学习采样三维卷积(LS3D-Conv)。我们在三维卷积上添加可学习的二维偏移量,以跨帧在空间特征图上采样位置。这些偏移量可针对特定任务学习。LS3D-Conv 可灵活替换现有三维网络中的三维卷积层并得到新架构,其在多个特征层级上学习采样。在视频插帧、视频超分辨率、视频去噪和动作识别上的实验证明了我们方法的有效性。

关键词

引用

@article{arxiv.2011.10974,
  title  = {Learnable Sampling 3D Convolution for Video Enhancement and Action Recognition},
  author = {Shuyang Gu and Jianmin Bao and Dong Chen},
  journal= {arXiv preprint arXiv:2011.10974},
  year   = {2020}
}