中文

HERMES:面向长尾场景的风险感知式多模态具身化系统

机器人学 2026-02-03 v1 人工智能

摘要

端到端自动驾驶模型日益受益于大型视觉-语言模型进行语义理解,但在长尾情况下的安全和准确运行仍具挑战。这些挑战在长尾混合交通情景中尤为突出,此时自动驾驶车辆必须在复杂不确定条件下与包含人类驾驶车辆和易受伤害路用人群在内的异构道路用户进行交互。本文提出HERMES,一个旨在将显式长尾风险线索注入轨迹规划的整体化风险感知式端到端多模态驾驶框架。HERMES采用基于基础模型的标注管道,生成结构化的长尾场景上下文和长尾规划上下文,捕获危险中心线索及maneuver意图和安全偏好,并利用这些信号指导端到端规划。HERMES进一步引入三模态驾驶模块,融合多视角感知、历史运动线索和语义指导,确保在长尾情景下进行风险感知式准确轨迹规划。在真实世界长尾数据集上的实验表明,HERMES在长尾混合交通情景中持续优于代表性端到端和VLM驱动的基准方法。消融研究验证了关键组件的互补贡献。

关键词

引用

@article{arxiv.2602.00993,
  title  = {HERMES: A Holistic End-to-End Risk-Aware Multimodal Embodied System with Vision-Language Models for Long-Tail Autonomous Driving},
  author = {Weizhe Tang and Junwei You and Jiaxi Liu and Zhaoyi Wang and Rui Gan and Zilin Huang and Feng Wei and Bin Ran},
  journal= {arXiv preprint arXiv:2602.00993},
  year   = {2026}
}