Label-Efficient LiDAR Semantic Segmentation with 2D-3D Vision Transformer Adapters
计算机视觉与模式识别
2025-03-06 v1
摘要
LiDAR语义分割模型通常从随机初始化进行训练,因为缺乏大型且多样化的数据集限制了通用预训练。此外,大多数点云分割架构包含自定义网络层,限制了从视觉基架构中取得进展的可移植性。鼓励近期在通用基础模型方面的进展,我们提出BALViT,一种新方法,利用冻结视觉模型作为无关特征编码器来学习强大的LiDAR编码器。具体而言,BALViT包含范围视图和鸟瞰视图LiDAR编码机制,我们通过一种新颖的2D-3D适配器将其组合。虽然范围视图特征通过冻结图像主干处理,但我们的鸟瞰视图分支通过多次交叉注意交互来增强它们。从而,我们不断通过领域依赖的知识来改进视觉网络, resulting in a strong label-efficient LiDAR encoding mechanism。在SemanticKITTI和nuScenes基准测试上的广泛评估表明,它在小数据 regime 下超过了当前的方法。我们在http://balvit.cs.uni-freiburg.de公开代码和模型。
引用
@article{arxiv.2503.03299,
title = {Label-Efficient LiDAR Semantic Segmentation with 2D-3D Vision Transformer Adapters},
author = {Julia Hindel and Rohit Mohan and Jelena Bratulic and Daniele Cattaneo and Thomas Brox and Abhinav Valada},
journal= {arXiv preprint arXiv:2503.03299},
year = {2025}
}