4D 时空卷积网络:闵可夫斯基卷积神经网络
计算机视觉与模式识别
2019-06-17 v4 人工智能
摘要
在许多机器人和 VR/AR 应用中,3D 视频是现成的输入源(深度图像的连续序列,或 LIDAR 扫描)。然而,这些 3D 视频是通过 2D 卷积网络或 3D 感知算法逐帧处理的。在这项工作中,我们提出了用于时空感知的 4 维卷积神经网络,可使用高维卷积直接处理此类 3D 视频。为此,我们采用稀疏张量并提出了涵盖所有离散卷积的广义稀疏卷积。为实现广义稀疏卷积,我们创建了一个用于稀疏张量的开源自动微分库,为高通卷积神经网络提供了广泛的函数。我们利用该库创建了 4D 时空卷积神经网络,并在各种 3D 语义分割基准和提出的用于 3D 视频感知的 4D 数据集上进行了验证。为克服 4D 空间中的挑战,我们提出了混合核(广义稀疏卷积的特例)以及三侧平稳条件随机场,后者在 7D 时空色度空间中强制时空一致性。通过实验,我们表明仅使用广义 3D 稀疏卷积的卷积神经网络可以大幅优于 2D 或 2D-3D 混合方法。此外,我们表明在 3D 视频上,4D 时空卷积神经网络对噪声具有鲁棒性,优于 3D 卷积神经网络,并且在某些情况下比 3D 对应网络更快。
引用
@article{arxiv.1904.08755,
title = {4D Spatio-Temporal ConvNets: Minkowski Convolutional Neural Networks},
author = {Christopher Choy and JunYoung Gwak and Silvio Savarese},
journal= {arXiv preprint arXiv:1904.08755},
year = {2019}
}
备注
CVPR'19