RangeSAM:视觉基础模型在距离视图表示的 LiDAR 分割中的潜力
计算机视觉与模式识别
2026-02-24 v4
摘要
点云分割是自动驾驶和 3D 场景理解的核心。虽然基于体素和点的方法由于与深度架构的兼容性及捕获细粒度几何结构的能力而在近期研究中占据主导地位,但它们通常计算成本高、内存访问不规则且实时效率有限。相比之下,距离视图方法尽管相对较少被探索,却能利用成熟的 2D 语义分割技术进行快速准确的预测。受视觉基础模型(VFM)在描述、零样本识别和多模态任务方面快速进展的启发,我们研究了 SAM2(当前分割任务的最先进 VFM)能否作为距离视图中 LiDAR 点云分割的强大骨干网络。据我们所知,我们提出了首个将 SAM2 适配至 3D 分割的距离视图框架,将高效的 2D 特征提取与标准投影/反投影相结合以处理点云。为了针对距离视图表示优化 SAM2,我们在编码器中实施了几项架构修改:(1)一个强调 LiDAR 距离图像中固有的水平空间依赖性的新模块;(2)针对球面投影几何特性定制的配置;(3)编码器骨干中专门设计用于捕获距离视图伪图像中独特空间模式与不连续性的适配机制。我们的方法在 SemanticKITTI 上取得了具有竞争力的性能,同时受益于以 2D 为中心的流程的速度、可扩展性和部署简便性。这项工作突出了 VFM 作为 3D 感知通用骨干网络的可行性,并为统一的、基础模型驱动的 LiDAR 分割开辟了道路。结果使我们得出结论,使用 VFM 的距离视图分割方法可带来有希望的结果。
引用
@article{arxiv.2509.15886,
title = {RangeSAM: On the Potential of Visual Foundation Models for Range-View represented LiDAR segmentation},
author = {Paul Julius Kühn and Duc Anh Nguyen and Arjan Kuijper and Saptarshi Neil Sinha},
journal= {arXiv preprint arXiv:2509.15886},
year = {2026}
}