SafeAuto:基于多模态基础模型的知识增强安全自主驾驶
机器人学
2025-06-09 v2 人工智能
机器学习
系统与控制
系统与控制
摘要
传统的自主驾驶系统常常难以将高层推理与底层控制连接起来,导致次优甚至不安全的行为。近期发展的多模态大语言模型 (MLLM) 能够处理视觉和文本数据,为统一感知与推理提供了机会。然而,有效地将精确的安全知识嵌入到用于自主驾驶的 MLLM 中仍是一个重大挑战。为此,我们提出了 SafeAuto 框架,通过包含结构化和非结构化知识来增强 MLLM 基于自主驾驶的功能。首先,我们引入位置相关交叉熵损失 (PDCE) 以改进文本表示值时的低层控制信号预测。其次,为显式集成安全知识,我们开发了推理组件,将交通规则转化为一阶逻辑(例如,“红灯 停止”),并将其嵌入概率图模型(例如马尔可夫逻辑网络)以验证识别环境属性后预测的动作。此外,我们的多模态检索增强生成 (Multimodal RAG) 模型利用视频、控制信号和环境属性来从过去的驾驶经验中学习。集成 PDCE、MLN 和多模态 RAG,SafeAuto 在多个数据集上超越了现有基线,实现了更准确、更可靠、更安全的自主驾驶。代码已公开于 https://github.com/AI-secure/SafeAuto。
引用
@article{arxiv.2503.00211,
title = {SafeAuto: Knowledge-Enhanced Safe Autonomous Driving with Multimodal Foundation Models},
author = {Jiawei Zhang and Xuan Yang and Taiqi Wang and Yu Yao and Aleksandr Petiushko and Bo Li},
journal= {arXiv preprint arXiv:2503.00211},
year = {2025}
}