通过混合视觉技术实现3D语义分割的增强效率:降低内存占用并加速推理
计算机视觉与模式识别
2024-07-24 v1
摘要
语义分割已成为计算机视觉中的关键研究领域,对于场景理解具有深远意义,并提升了跨领域的人机交互。虽然2D语义分割在轻量化、高精度模型方面取得了显著进展,但向3D语义分割迁移则面临独特挑战。我们的研究致力于实现3D语义分割模型的效率和轻量化设计,类似于2D模型所达到的水平。这一设计将影响内存和延迟敏感的3D语义分割应用场景。本文引入一种新颖的3D语义分割方法,区别在于融合了2D和3D计算机视觉技术的混合方法,实现了简洁高效的流程。我们对RGB图像上的2D语义分割进行处理,图像与3D点云关联,然后通过对特定类别标签进行挤出技术,将结果扩展到3D空间,从而缩小点云子空间。我们以在KITTI-360数据集上对完整点云进行严格评估为基准,测量Intersection over Union (IoU)准确率、推理时间延迟和内存消耗。该模型是当前KITTI-360数据集上最先进的3D语义分割模型(DeepViewAgg)。我们实现的分割精度在6个类别中超越基准,对剩余10个类别保持约1%的性能下降。我们的分割方法相较于基准实现了1.347倍的加速,并约降低了43%的内存占用。
关键词
引用
@article{arxiv.2407.16102,
title = {Augmented Efficiency: Reducing Memory Footprint and Accelerating Inference for 3D Semantic Segmentation through Hybrid Vision},
author = {Aditya Krishnan and Jayneel Vora and Prasant Mohapatra},
journal= {arXiv preprint arXiv:2407.16102},
year = {2024}
}
备注
18 pages, 3 figures, 3 tables