中文

视觉与语言:用于驾驶场景安全评估与自动驾驶车辆规划的新型表征与人工智能

计算机视觉与模式识别 2026-02-19 v2 人工智能 机器学习 机器人学

摘要

视觉-语言模型(VML)最近涌现为强大的表征学习系统,通过将视觉观察与自然语言概念对齐,为语义推理在安全关键的自动驾驶领域提供了新机会。本文研究了视觉-语言表征如何集成到感知、预测和规划管道中,以支持驾驶场景安全评估与决策。我们研究了三个互补的系统级用例。首先,我们引入一种轻量级、类别无关的危险筛查方法,利用 CLIP 基于图像-文本相似度产生低延迟语义危险信号。这使我们能够在没有显式目标检测或视觉问答的情况下,对检测多样且超出分布的道路危险。其次,我们检查了将场景级视觉-语言嵌入集成到基于 transformer 的轨迹规划框架中使用 Waymo Open 数据集。我们的结果表明,盲目在全局嵌入上条件化规划器不会提高轨迹准确性,这突显了表示-任务对齐的重要性,并动机开发面向安全关键规划的任务感知提取方法。第三,我们研究自然语言作为运动规划的显式行为约束,使用 doScenes 数据集。在这种情况下,基于视觉场景元素 grounding 的乘客式指令抑制了罕见但严重的规划失败,并在模糊场景中改善了安全对齐的行为。综上,这些发现表明,视觉-语言表征在自动驾驶安全方面具有重要潜力,当用于表达语义风险、意图和行为约束时具有显著 promise。实现这一潜力根本是一个工程问题,需要仔细的系统设计和结构化 grounding 而非直接特征注入。

关键词

引用

@article{arxiv.2602.07680,
  title  = {Vision and Language: Novel Representations and Artificial intelligence for Driving Scene Safety Assessment and Autonomous Vehicle Planning},
  author = {Ross Greer and Maitrayee Keskar and Angel Martinez-Sanchez and Parthib Roy and Shashank Shriram and Mohan Trivedi},
  journal= {arXiv preprint arXiv:2602.07680},
  year   = {2026}
}