CoCMT:面向协同感知的数据高效跨模态Transformer
机器学习
2025-07-02 v2 人工智能
计算机视觉与模式识别
机器人学
摘要
多智能体协同感知通过共享感知信息来增强每个智能体的感知能力,以协作方式完成机器人感知任务。该方法在解决传感器不足、遮挡和远距离感知等挑战方面效果显著。然而,现有代表性的协同感知系统传输中间特征图,如鸟瞰视图(BEV)表示,其中包含大量非关键信息,导致通信带宽需求高。为在保持感知能力的同时提升通信效率,我们引入CoCMT,一种基于对象查询的协作框架,通过选择性提取和传输关键特征来优化通信带宽。在CoCMT中,我们引入高效查询Transformer(EQFormer)来有效融合多智能体对象查询,并实现协同深度监督,以增强各阶段的正向强化,显著提升整体性能。在OPV2V和V2V4Real数据集上的实验表明,CoCMT在大幅降低通信需求的同时超越了当前最先进的方法。在V2V4Real上,采用Top-50对象查询的模型仅需0.416 Mb带宽,比SOTA方法低83倍,同时将AP70提升1.1个百分点。这种效率突破使我们能够在不牺牲检测精度的前提下,将协同感知部署到带宽受限的环境中。
关键词
引用
@article{arxiv.2503.13504,
title = {CoCMT: Communication-Efficient Cross-Modal Transformer for Collaborative Perception},
author = {Rujia Wang and Xiangbo Gao and Hao Xiang and Runsheng Xu and Zhengzhong Tu},
journal= {arXiv preprint arXiv:2503.13504},
year = {2025}
}