结合多模态融合与 V2X 协作的端到端三维时空感知
计算机视觉与模式识别
2025-12-29 v1
摘要
多视角协同感知与多模态融合对于自动驾驶中可靠的三维时空理解至关重要,尤其是在 V2X 场景下的遮挡、有限视角和通信延迟环境中。本文提出了 XET-V2X,一个用于 v2x 协作的多模态融合端到端跟踪框架,该框架在共享的时空表示内统一了多视角多模态感知。为了高效对齐异构视角和模态,XET-V2X 引入了基于多尺度可变形注意力的双层空间交叉注意力模块。多视角图像特征首先被聚合以增强语义一致性,随后由更新后的空间查询引导进行点云融合,从而在减少计算开销的同时实现有效的跨模态交互。在真实世界 V2X-Seq-SPD 数据集和模拟的 V2X-Sim-V2V 与 V2X-Sim-V2I 基准上的实验表明,在不同通信延迟下检测和跟踪性能均有持续提升。定量结果和定性可视化均表明,XET-V2X 在复杂交通场景中实现了鲁棒且时间稳定的感知。
引用
@article{arxiv.2512.21831,
title = {End-to-End 3D Spatiotemporal Perception with Multimodal Fusion and V2X Collaboration},
author = {Zhenwei Yang and Yibo Ai and Weidong Zhang},
journal= {arXiv preprint arXiv:2512.21831},
year = {2025}
}
备注
19 pages, 19 figures