中文

面向基于体素的 3D 数据感知的频域学习

计算机视觉与模式识别 2023-02-22 v2 图像与视频处理

摘要

频域学习因其在推理精度与输入数据量之间的优越权衡而受到关注。二维计算机视觉任务中的频域学习已表明,二维卷积神经网络(CNN)对低频通道具有平稳的频谱偏置,因此可剪枝高频通道而不产生或仅产生极小的精度下降。然而,针对三维体素数据的三维 CNN 上下文中的频域学习尚未被研究。本文研究面向基于体素的 3D 数据感知的频域学习,以揭示三维 CNN 的频谱偏置及精度-输入数据量权衡。我们的研究发现,三维 CNN 对有限数量的关键频域通道敏感,尤其是低频通道。实验结果表明,频域学习可基于频谱偏置显著减小基于体素的 3D 输入规模,同时达到与传统空域学习方法相当的精度。具体而言,在三维形状分类中频域学习可将输入数据量减小 98%,而平均精度下降控制在 2% 以内;在三维点云语义分割中减小 98% 输入数据量,平均类别精度提升 1.48%,同时平均类别 IoU 损失控制在 1.55% 以内。此外,通过学习更高分辨率的三维数据(即空域中原始图像的 2 倍),频域学习在三维点云语义分割中将平均类别精度与平均类别 IoU 分别提升 3.04% 和 0.63%,同时实现 87.5% 的输入数据量缩减。

关键词

引用

@article{arxiv.2302.08595,
  title  = {Frequency-domain Learning for Volumetric-based 3D Data Perception},
  author = {Zifan Yu and Suya You and Fengbo Ren},
  journal= {arXiv preprint arXiv:2302.08595},
  year   = {2023}
}

备注

13 pages