AD-SAM:针对自动驾驶感知微调的 Segment Anything 视觉基础模型
摘要
本文提出了自动驾驶 Segment Anything 模型(AD-SAM),这是一种针对自动驾驶语义分割的微调视觉基础模型。AD-SAM 扩展了 Segment Anything Model(SAM),采用双编码器和可变形解码器,以适应道路场景的空间和几何复杂度。双编码器通过结合 SAM 预训练的 Vision Transformer(ViT-H)提供的全局语义上下文,以及可训练的卷积深度学习主干(即 ResNet-50)提供的局部空间细节,产生多尺度融合表示。可变形融合模块跨尺度和物体几何对异构特征进行对齐。解码器执行分阶段的多尺度细化,使用可变形注意力。训练由融合 Focal、Dice、Lovasz-Softmax 和 Surface 损失指导,改善语义类别平衡、边界精度和优化稳定性。在 Cityscapes 和伯克利深驾驶 100K(BDD100K)基准测试中,AD-SAM 超过 SAM、Generalized SAM(G-SAM)和深度学习基线(DeepLabV3)在分割精度方面。它在 Cityscapes 上实现了 68.1 的平均交并比(mIoU),在 BDD100K 上实现了 59.5 mIoU,分别比 SAM、G-SAM 和 DeepLabV3 提升了最高可达 +22.9 和 +19.2 mIoU。AD-SAM 在跨域泛化方面表现强劲,保持率为 0.87(相对于 SAM 的 0.76),学习速度更快,更稳定,在 30-40 个 epoch 内即可收敛,学习速度是基准模型的一倍。仅用 1000 个样本即可保持 0.607 mIoU,表明数据效率对减少标注成本至关重要。这些结果确认,针对基础模型进行有针对性的架构和优化增强,即可实现可靠且可扩展的自动驾驶感知。
引用
@article{arxiv.2510.27047,
title = {AD-SAM: Fine-Tuning the Segment Anything Vision Foundation Model for Autonomous Driving Perception},
author = {Mario Camarena and Het Patel and Fatemeh Nazari and Evangelos Papalexakis and Mohamadhossein Noruzoliaee and Jia Chen},
journal= {arXiv preprint arXiv:2510.27047},
year = {2025}
}
备注
Submitted to IEEE Transactions on Intelligent Transportation Systems (IEEE T-ITS)