中文

感知机合成网络:重新思考视频中的动作尺度差异

计算机视觉与模式识别 2022-04-20 v3 机器学习 图像与视频处理

摘要

视频动作识别已通过堆叠固定尺寸三维核的CNN部分解决。然而,这些方法可能因仅在单尺度空间中捕捉刚性的时空模式,而忽略了不同动作基元间的尺度差异,从而导致性能不佳。为克服此局限,我们提出从数据中学习最优尺度核。更具体地,提出一种动作感知机合成器,从一袋由密集路由路径交互的固定尺寸核中生成核。为保证路径的交互丰富性与信息容量,我们设计了新颖的优化特征融合层。该层首次建立了一个原则性的通用范式,足以涵盖当前大多数特征融合技术(例如通道混洗与通道丢弃)。通过插入该合成器,我们的方法能以极小的额外计算代价轻松将传统二维CNN适配到动作识别等视频理解任务。所提方法在几个极具挑战性、高度需要时序推理或外观判别的数据集(即Something-to-Something、Kinetics与Diving48)上进行了充分评估,取得了新的SOTA结果。特别地,我们的低分辨率模型以不到30%的计算代价优于近期强基线方法TSM与GST。

关键词

引用

@article{arxiv.2007.11460,
  title  = {Perceptron Synthesis Network: Rethinking the Action Scale Variances in Videos},
  author = {Yuan Tian and Guangtao Zhai and Zhiyong Gao},
  journal= {arXiv preprint arXiv:2007.11460},
  year   = {2022}
}