面向自动驾驶的 SAM 增强分割:在道路数据集上平衡关键类别
计算机视觉与模式识别
2026-05-28 v1 机器人学
摘要
密集语义分割是自动驾驶的关键任务,而许多多模态数据集缺乏像素级标注。Zenseact Open Dataset (ZOD) 提供丰富的多传感器数据但仅提供边界框标签,限制了其用于分割研究的使用。我们的主要贡献是基于 Segment Anything Model (SAM) 的标注管线,通过将边界框转换为语义掩码,为 ZOD 生成密集的像素级标注。在本 pilot 研究中,我们处理了超过 100,000 帧,并手动精选了 2,300 帧子集(36% 接受率)以建立可靠的基线。使用这些标注,我们评估了基于变换器的 CLFT 和基于 CNN 的 DeepLabV3+ 架构,横跨多种天气条件,实现最高达48.1%的 mIoU。为了解决极端类别不平衡问题(行人、骑自行车者和标志牌构成不足1%的像素),我们探索针对稀有类别的专门模型。我们进一步在 Iseauto 自动驾驶平台上进行验证,实现了77.5%的 mIoU,表明 SAM 派生的表示通过双向迁移学习有效地跨越传感器配置。所有代码和标注均已发布以支持可重复研究。
引用
@article{arxiv.2605.28136,
title = {SAM-Enhanced Segmentation on Road Datasets: Balancing Critical Classes in Autonomous Driving},
author = {Toomas Tahves and Mauro Bellone and Junyi Gu and Raivo Sell},
journal= {arXiv preprint arXiv:2605.28136},
year = {2026}
}