Segment Any Vehicle:基于 SAM 的语义和视觉上下文驱动方法及基准
计算机视觉与模式识别
2025-08-07 v1 人工智能
机器学习
摘要
随着自动驾驶技术的快速发展,车辆感知,特别是检测和分割,正对算法性能提出日益严苛的要求。预训练的大规模分割模型,尤其是 Segment Anything Model(SAM),已引发广泛兴趣并催生了人工智能领域的新研究方向。然而,SAM 无法直接应用于车辆部件细粒度分割任务,因为其文本提示分割功能尚未公开,且默认模式生成的掩码区域缺乏语义标签,限制了其在结构化、类别特定分割任务中的实用性。为此,我们提出了 SAV,一种新型框架,包含三个核心组件:基于 SAM 的编码器-解码器、车辆部件知识图谱和情境样本检索编码模块。知识图谱通过结构化本体建模车辆部件的空间和几何关系,有效编码先验结构知识。而情境检索模块通过识别并利用训练数据中视觉上相似的车辆实例,为改进分割提供丰富的情境先验。此外,我们引入了一个新的大规模基准数据集用于车辆部件分割,命名为 VehicleSeg10K,包含 11,665 组高质量的像素级标注,覆盖多样化场景和视角。我们在该数据集上以及两个其他数据集上进行了全面实验,为未来研究和比较奠定了坚实基础。% 本论文的数据集和源代码将在接受后发布。数据集和源代码将在 https://github.com/Event-AHU/SAV 上发布。
引用
@article{arxiv.2508.04260,
title = {Segment Any Vehicle: Semantic and Visual Context Driven SAM and A Benchmark},
author = {Xiao Wang and Ziwen Wang and Wentao Wu and Anjie Wang and Jiashu Wu and Yantao Pan and Chenglong Li},
journal= {arXiv preprint arXiv:2508.04260},
year = {2025}
}