中文

V2XPnP:基于车到一切 (V2X) 车-时空融合的多智能体感知与预测

计算机视觉与模式识别 2025-08-07 v3

摘要

车到一切 (V2X) 技术提供了缓解单车系统受限可观测性限制的有前景的范例。先前的工作主要关注单帧合作感知,这类方法在不同空间位置融合智能体信息,但忽略了时序线索和时序任务(如时序感知和预测)。本文聚焦于 V2X 场景中的时空融合,设计了单步和多步通信策略(何时发送),并考察了其与三种融合策略——早期、晚期和中间(应发送什么)——的集成,提供了 11 个融合模型(如何融合)的全面基准测试。Furthermore, 我们提出了 V2XPnP,一个用于单步通信的端到端感知和预测的新型中间融合框架。我们的框架采用统一的 Transformer-based 架构,有效地建模多个智能体、帧和高清地图之间的复杂时空关系。此外,我们引入了 V2XPnP Sequential Dataset,以支持所有 V2X 协作模式,弥补了现有真实数据集仅限于单帧或单模式合作的局限性。大量实验表明,我们的框架在感知和预测任务中均优于最先进的方法。

关键词

引用

@article{arxiv.2412.01812,
  title  = {V2XPnP: Vehicle-to-Everything Spatio-Temporal Fusion for Multi-Agent Perception and Prediction},
  author = {Zewei Zhou and Hao Xiang and Zhaoliang Zheng and Seth Z. Zhao and Mingyue Lei and Yun Zhang and Tianhui Cai and Xinyi Liu and Johnson Liu and Maheswari Bajji and Xin Xia and Zhiyu Huang and Bolei Zhou and Jiaqi Ma},
  journal= {arXiv preprint arXiv:2412.01812},
  year   = {2025}
}

备注

ICCV 2025, Website link: https://mobility-lab.seas.ucla.edu/v2xpnp/