Semantic-Drive:通过开放词汇定位与神经符号 VLM 共识普及长尾数据筛选
计算机视觉与模式识别
2025-12-17 v2 人工智能
计算与语言
机器人学
摘要
鲁棒自动驾驶汽车(AVs)的发展受到“长尾”训练数据稀缺的瓶颈制约。尽管车队收集了数 PB 的视频日志,但识别罕见的安全关键事件(例如,乱穿马路的行人、施工改道)仍然是一个耗资巨大且依赖人工的过程。现有解决方案依赖于缺乏精度的粗略元数据搜索,或是侵犯隐私且昂贵的基于云的 VLM。我们引入了 Semantic-Drive,一个用于语义数据挖掘的本地优先、神经符号框架。我们的方法将感知解耦为两个阶段:(1)通过实时开放词汇检测器(YOLOE)进行符号定位以锚定注意力,以及(2)通过执行法医场景分析的推理 VLM 进行认知分析。为了缓解幻觉,我们实施了一种“系统 2”推理时对齐策略,利用多模型“Judge-Scout”共识机制。在 nuScenes 数据集上针对 Waymo Open Dataset(WOD-E2E)分类法进行基准测试,Semantic-Drive 达到了 0.966 的召回率(相比之下,CLIP 为 0.475),并且与最佳的单 scout 模型相比,将风险评估误差降低了 40%。该系统完全在消费级硬件(NVIDIA RTX 3090)上运行,提供了一种保护隐私的云端替代方案。
引用
@article{arxiv.2512.12012,
title = {Semantic-Drive: Democratizing Long-Tail Data Curation via Open-Vocabulary Grounding and Neuro-Symbolic VLM Consensus},
author = {Antonio Guillen-Perez},
journal= {arXiv preprint arXiv:2512.12012},
year = {2025}
}