Smaller3d:基于 Minkowski 引擎与知识蒸馏方法的更小规模 3D 语义分割模型
计算机视觉与模式识别
2023-05-08 v1 人工智能
摘要
在 3D 领域存在多种优化技术,包括基于点云的方法,其利用网格、纹理与体素来优化 3D 中的存储与计算方式。这些方法采用前馈网络、3D 卷积、图神经网络、transformers 与稀疏张量等手段。然而,3D 领域是计算开销最为昂贵的领域之一,且这些方法因其巨大容量、复杂性与计算限制而尚未发挥全部潜力。本文提出应用知识蒸馏技术,特别是针对 3D 深度学习中的稀疏张量,以在保持性能的同时缩减模型规模。我们分析并提出了不同的损失函数,包括标准方法以及多种损失的组合,以模拟不同稀疏卷积神经网络(Sparse Convolutional NNs)最先进模型的性能。我们的实验在标准 ScanNet V2 数据集上进行,基于最新的最先进时空卷积基模型,我们实现了约 2.6% mIoU 差异(模型缩小 4 倍)以及约 8% 差异(模型缩小 16 倍)。
引用
@article{arxiv.2305.03188,
title = {Smaller3d: Smaller Models for 3D Semantic Segmentation Using Minkowski Engine and Knowledge Distillation Methods},
author = {Alen Adamyan and Erik Harutyunyan},
journal= {arXiv preprint arXiv:2305.03188},
year = {2023}
}