并非所有体素都平等:基于硬度感知与自蒸馏的语义场景补全
计算机视觉与模式识别
2024-04-19 v1 机器人学
摘要
语义场景补全,也称为语义占用预测,能够为自动驾驶车辆提供密集的几何和语义信息,吸引了学术界和工业界越来越多的关注。不幸的是,现有方法通常将此任务视为体素级分类问题,并在训练过程中平等对待3D空间中的每个体素。由于困难体素未得到足够重视,在一些挑战性区域的性能有限。3D密集空间通常包含大量空体素,这些体素易于学习,但由于现有模型统一处理所有体素,需要大量计算。此外,边界区域的体素比内部体素更难区分。在本文中,我们提出了HASSC方法,通过硬度感知设计来训练语义场景补全模型。定义了来自网络优化过程的全局硬度,用于动态选择困难体素。然后,采用具有几何各向异性的局部硬度进行体素级细化。此外,引入自蒸馏策略使训练过程稳定且一致。大量实验表明,我们的HASSC方案能够有效提升基线模型的精度,且不引入额外推理成本。源代码可在https://github.com/songw-zju/HASSC获取。
引用
@article{arxiv.2404.11958,
title = {Not All Voxels Are Equal: Hardness-Aware Semantic Scene Completion with Self-Distillation},
author = {Song Wang and Jiawei Yu and Wentong Li and Wenyu Liu and Xiaolu Liu and Junbo Chen and Jianke Zhu},
journal= {arXiv preprint arXiv:2404.11958},
year = {2024}
}
备注
Accepted by CVPR2024