3D CNN 中的时空融合:一种概率视角
计算机视觉与模式识别
2020-04-13 v1
摘要
尽管在静态图像识别中取得成功,用于时空信号任务(如视频中的人体动作识别)的深度神经网络多年来仍受困于低效能与低效率。近来,人类专家投入更多精力分析 3D 卷积神经网络(3D CNNs)中不同组件的重要性,以设计更强大的时空学习骨干网络。其中,时空融合是关键要素之一。它控制着推理过程中每一层空间和时间信号的提取方式。以往的尝试通常从临时设计出发,经验性地组合某些卷积,然后基于训练相应网络所获得的性能得出结论。这些方法仅支持对有限数量融合策略的网络级分析。本文中,我们提出将时空融合策略转换为概率空间,这使得我们能够在无需分别训练的情况下对各种融合策略进行网络级评估。此外,我们还能获得细粒度数值信息,例如概率空间内对时空融合的层级别偏好。我们的方法极大提升了分析时空融合的效率。基于该概率空间,我们进一步生成了新的融合策略,在四个知名动作识别数据集上取得了最先进的性能。
引用
@article{arxiv.2004.04981,
title = {Spatiotemporal Fusion in 3D CNNs: A Probabilistic View},
author = {Yizhou Zhou and Xiaoyan Sun and Chong Luo and Zheng-Jun Zha and Wenjun Zeng},
journal= {arXiv preprint arXiv:2004.04981},
year = {2020}
}
备注
To be published in IEEE Conference on Computer Vision and Pattern Recognition (CVPR), 2020