V2X-UniPool:面向自动驾驶的多模态感知与知识推理统一框架
人工智能
2025-10-06 v2
摘要
自动驾驶(AD)已取得显著进展,但单车感知仍受限于传感范围和遮挡。车联网(V2X)通信通过实现车辆与基础设施间的协作来解决这些限制,但也面临异构性、同步和延迟约束。语言模型提供了强大的知识驱动推理与决策能力,但其本质上并非为处理原始传感器流而设计,且容易产生幻觉。我们提出了 V2X-UniPool,这是首个将 V2X 感知与基于语言的推理相统一以实现知识驱动 AD 的框架。它将多模态 V2X 数据转换为结构化的、基于语言的知识,将其组织在时间索引的知识池中以实现时间一致的推理,并采用检索增强生成(RAG)将决策锚定于实时上下文。在真实世界 DAIR-V2X 数据集上的实验表明,V2X-UniPool 实现了最先进的规划准确性和安全性,同时将通信成本降低了 80% 以上,在所有评估方法中开销最低。这些结果突显了桥接 V2X 感知与语言推理以推进可扩展且可信驾驶的前景。我们的代码可在:https://github.com/Xuewen2025/V2X-UniPool 获取
引用
@article{arxiv.2506.02580,
title = {V2X-UniPool: Unifying Multimodal Perception and Knowledge Reasoning for Autonomous Driving},
author = {Xuewen Luo and Fengze Yang and Fan Ding and Xiangbo Gao and Shuo Xing and Yang Zhou and Zhengzhong Tu and Chenxi Liu},
journal= {arXiv preprint arXiv:2506.02580},
year = {2025}
}