透视于可观测性:基于视觉语言模型的自动驾驶潜在风险推理
机器人学
2025-12-01 v1
摘要
确保安全性仍是自动驾驶车辆(AVs)面临的关键挑战,尤其是在罕见且复杂的场景中。一个critical但鲜有研究的方面是"潜在风险"情形,即风险尚不可观测,但可从细微前兆(如异常行为或常识违背)推断得出。识别这些前兆需要强大的语义理解与推理能力,而当前AV系统由于缺乏此类案例在现有驾驶或风险中心数据集中,往往缺乏这些能力。此外,当前的自动驾驶事故数据集常缺少事件背后因果推理链的标注,这对于在风险变得可观测之前识别潜在风险至关重要。为此,我们引入PotentialRiskQA,一个 novel 的视觉语言数据集,旨在进行潜在风险推理。每个样本标注有结构化的场景描述、语义前兆以及推断出的风险结果。基于此数据集,我们进一步提出PR-Reasoner,一个专为 onboard 潜在风险推理设计的视觉语言模型框架。实验结果表明,在PotentialRiskQA上微调的PR-Reasoner在潜在风险推理任务上的性能显著优于基线VLMs。我们的数据集和模型为开发具备更好预见性和主动安全能力的自动系统提供了基础,朝着更智能和更具韧性的AVs发展。
引用
@article{arxiv.2511.22928,
title = {Seeing before Observable: Potential Risk Reasoning in Autonomous Driving via Vision Language Models},
author = {Jiaxin Liu and Xiangyu Yan and Liang Peng and Lei Yang and Lingjun Zhang and Yuechen Luo and Yueming Tao and Ashton Yu Xuan Tan and Mu Li and Lei Zhang and Ziqi Zhan and Sai Guo and Hong Wang and Jun Li},
journal= {arXiv preprint arXiv:2511.22928},
year = {2025}
}