中文

SafeDriveRAG:面向安全自主驾驶的基于知识图谱的检索增强生成

人工智能 2025-07-30 v1

摘要

本文研究了如何利用视觉语言模型 (VLM) 来增强自主驾驶系统的安全性,包括感知、情境理解和路径规划。然而,现有研究在交通安全关键驾驶情景中忽略了对这些模型的评估。为弥合这一差距,我们创建了基准 (SafeDrive228K),并提出了一种新的基线方法,基于 VLM 结合知识图谱的检索增强生成 (SafeDriveRAG) 用于视觉问答 (VQA)。具体而言,我们引入 SafeDrive228K,首个大规模多模态问答基准,包含 228K 个示例,涵盖 18 个子任务。该基准涵盖了从交通事故和边界情况到常见安全知识的多样化交通安全查询,使我们能够全面评估模型的理解和推理能力。此外,我们提出了一种即插即用的多模态知识图谱检索增强生成方法,采用新颖的多尺度子图检索算法实现高效信息检索。通过整合来自互联网的交通安全指南,该框架进一步增强了模型处理安全关键情境的能力。最后,我们在五个主流 VLM 上进行了全面评估,以评估其在安全敏感驾驶任务中的可靠性。实验结果表明,集成 RAG 显著提升了性能,在五个主流 VLM 中分别在交通事故任务中提升 +4.73%,边界情况任务中提升 +8.79%,交通安全常识中提升 +14.57%,凸显了我们提出的基准和方法在推动交通安全研究方面的潜力。我们的源代码和数据已在 https://github.com/Lumos0507/SafeDriveRAG 上提供。

关键词

引用

@article{arxiv.2507.21585,
  title  = {SafeDriveRAG: Towards Safe Autonomous Driving with Knowledge Graph-based Retrieval-Augmented Generation},
  author = {Hao Ye and Mengshi Qi and Zhaohong Liu and Liang Liu and Huadong Ma},
  journal= {arXiv preprint arXiv:2507.21585},
  year   = {2025}
}