基于边缘的多模态传感器数据融合与视觉语言模型(VLM)用于实时自动驾驶事故避免
人工智能
2025-08-13 v2 机器人学
摘要
仅依赖 onboard 传感器的自动驾驶(AD)系统可能无法检测远距离或障碍物风险,导致可防止的碰撞;然而,现有的基于变换器的 Vehicle-to-Everything(V2X)方法虽能缓解 AD 感知局限,却缺乏有效的多模态融合与推理,或在复杂多维交通条件下难以满足实时性能要求。本文提出了基于 fine-tuned 轻量级视觉语言模型(VLM)的实时边缘式自动协作轨迹规划器(REACT),这是一种集成 V2X 的轨迹优化框架,用于 AD。REACT 将基础设施提供的危险警报与 onboard 传感器数据融合,通过视觉嵌入捕获复杂的周围交通动态与车辆意图,解释符号输入中的精确数值数据,并运用情境推理生成优化的安全轨迹。为确保在边缘设备上实现可靠的实时部署,REACT 创新性地采用残差轨迹融合(RTF)设计和专门的边缘适应策略,以降低模型复杂度并提高推理效率。在 DeepAccident 数据集上评估,REACT 实现了领先的性能,碰撞率降低 77%,视频全景质量(VPQ)为 48.2%,在 Jetson AGX Orin 上推理延迟为 0.57 秒。消融实验验证了每个输入、模块和边缘适应策略的贡献。这些结果凸显了轻量级 VLM 在边缘平台上实现实时协作规划的有效性,以及语言引导的情境推理在提高交通安全和响应速度方面的潜力。
引用
@article{arxiv.2508.01057,
title = {Edge-Based Multimodal Sensor Data Fusion with Vision Language Models (VLMs) for Real-time Autonomous Vehicle Accident Avoidance},
author = {Fengze Yang and Bo Yu and Yang Zhou and Xuewen Luo and Zhengzhong Tu and Chenxi Liu},
journal= {arXiv preprint arXiv:2508.01057},
year = {2025}
}
备注
24 pages, 6 tables, 7 figures