中文

面向视觉语言模型集成式真实世界自动驾驶的分层测试平台

机器人学 2025-06-18 v1 系统与控制 系统与控制

摘要

视觉语言模型(VLM)通过在大量图像-文本对上进行预训练,提供了多模态推理的潜力,在自动驾驶领域展现出显著前景。然而,将这些模型从广泛的网络规模数据适配到安全关键的驾驶场景,是一个重大挑战,通常称为领域偏移。现有的基于仿真和数据集驱动的评估方法,虽然有价值,但往往无法捕捉真实世界场景的全部复杂性,并且难以轻松实现可重复的闭环测试和灵活的场景操控。在本文中,我们介绍了一个专门用于评估集成VLM的自动驾驶系统的分层真实世界测试平台。我们的方法包括:一个模块化、低延迟的车载中间件,可无缝集成各种VLM;一个清晰分离的感知-规划-控制架构,可容纳基于VLM和传统的模块;以及一套在封闭赛道上可配置的真实世界测试场景,支持受控但真实的评估。我们通过一个涉及启用VLM的自动驾驶车辆的案例研究,展示了所提出平台的测试和评估能力的有效性,突出了我们的测试框架如何在多样化条件下支持稳健的实验。

关键词

引用

@article{arxiv.2506.14100,
  title  = {A Hierarchical Test Platform for Vision Language Model (VLM)-Integrated Real-World Autonomous Driving},
  author = {Yupeng Zhou and Can Cui and Juntong Peng and Zichong Yang and Juanwu Lu and Jitesh H Panchal and Bin Yao and Ziran Wang},
  journal= {arXiv preprint arXiv:2506.14100},
  year   = {2025}
}