面向多智能体协同感知的 S2R-ViT:弥合从仿真到现实的鸿沟
计算机视觉与模式识别
2024-02-22 v4
摘要
由于缺乏足够的真实多智能体数据与耗时的标注,现有多智能体协同感知算法通常选用仿真传感器数据进行训练与验证。然而,由于仿真与真实数据间显著的域鸿沟,这些经仿真训练的模型部署至真实世界时感知性能下降。本文提出首个面向多智能体协同感知的仿真到现实(Simulation-to-Reality)迁移学习框架,采用一种新颖的视觉 Transformer(Vision Transformer),命名为 S2R-ViT,其同时考量仿真与真实数据间的部署鸿沟与特征鸿沟。我们探究了这两类域鸿沟的影响,并提出一种新颖的不确定性感知视觉 Transformer 以有效缓解部署鸿沟,以及一种带智能体间与自车智能体判别器的基于智能体的特征适配模块以缩减特征鸿沟。在公开多智能体协同感知数据集 OPV2V 与 V2V4Real 上的充分实验表明,所提 S2R-ViT 能有效弥合从仿真到现实的鸿沟,并在基于点云的 3D 目标检测上显著优于其他方法。
引用
@article{arxiv.2307.07935,
title = {S2R-ViT for Multi-Agent Cooperative Perception: Bridging the Gap from Simulation to Reality},
author = {Jinlong Li and Runsheng Xu and Xinyu Liu and Baolu Li and Qin Zou and Jiaqi Ma and Hongkai Yu},
journal= {arXiv preprint arXiv:2307.07935},
year = {2024}
}
备注
submit the latest one, accepted by the 2024 IEEE International Conference on Robotics and Automation (ICRA)