中文

DriveSafe:面向驾驶场景的风险检测与安全建议框架

计算机视觉与模式识别 2026-05-19 v1 人工智能 计算与语言

摘要

全面的 situational awareness 对在安全关键环境中运行的自动驾驶车辆至关重要,因为它使我们能够识别和缓解潜在风险。尽管最近的多模态大语言模型(MLLMs)在通用视觉语言任务方面显示出前景,但我们的研究表明,零样本 MLLMs 在细粒度、空间定位风险评估方面的表现仍不如领域特定方法。为弥合这一差距,我们提出了 DriveSafe,一种面向风险感知场景理解的框架,利用结构化自然语言描述。具体而言,我们的方法首先生成包含运动、空间和深度线索的空间定位描述性文字。随后,这些描述用于风险评估,显式地识别危险对象、其位置以及不安全行为的含义,并提出可操作的安全建议。为进一步提升性能,我们采用描述-风险配对对轻量级适配器模块进行微调,高效地将领域特定知识注入基础大语言模型。通过以显式语言为场景表示为条件进行风险评估,DriveSafe 在零样本 MLLMs 以及先前的领域特定基线方法上实现了显著的性能提升。在 DRAMA 基准上的 exhaustive 实验表明其达到了最好的性能,而消融研究则验证了我们关键设计选择的有效性。项目页面:https://cvit.iiit.ac.in/research/projects/cvit-projects/drivesafe

关键词

引用

@article{arxiv.2605.16892,
  title  = {DriveSafe: A Framework for Risk Detection and Safety Suggestions in Driving Scenarios},
  author = {Sainithin Artham and Shankar Gangisetty and Avijit Dasgupta and C. V. Jawahar},
  journal= {arXiv preprint arXiv:2605.16892},
  year   = {2026}
}

备注

8 pages