通过从视觉基础模型蒸馏实现室内帧级激光点语义分割的可行性
计算机视觉与模式识别
2026-04-22 v1 机器人学
摘要
室内激光点扫描的帧级语义分割是实现更高级 3D 场景理解和映射应用的基本步骤。然而,获取用于训练深度学习模型的帧级 ground truth 代价高昂且耗时。这一挑战在图像层面已通过视觉基础模型 (VFM) 实现帧级分割。相同的 VFM 可用于通过 2D 到 3D 蒸馏管道训练激光点扫描帧分割模型。这种蒸馏在自动驾驶场景中已成功验证,但尚未在室内场景中实现。本文研究了以帧级蒸馏方式将其重复用于室内场景的可行性,即通过将每个激光点扫描与 VFM 处理的相机图像耦合在一起。评估使用室内 SLAM 数据集进行,其中用于下游评估的伪标签被采用。也提供了一个小型手动标注的激光点数据集用于验证,因其他室内激光点帧级数据集尚不存在。结果表明,蒸馏模型在伪标签评估下可达最高 56% 的 mIoU,并在 real-label 条件下达到约 36% 的 mIoU,表明在无需手动标注的情况下通过跨模态蒸馏实现室内激光点语义分割是可行的。
引用
@article{arxiv.2604.18831,
title = {Feasibility of Indoor Frame-Wise Lidar Semantic Segmentation via Distillation from Visual Foundation Model},
author = {Haiyang Wu and Juan J. Gonzales Torres and George Vosselman and Ville Lehtola},
journal= {arXiv preprint arXiv:2604.18831},
year = {2026}
}