CMX:基于 Transformer 的 RGB-X 语义分割跨模态融合
计算机视觉与模式识别
2023-11-27 v5 机器人学
图像与视频处理
摘要
基于图像分割的场景理解是自动驾驶车辆的关键组成部分。RGB 图像的像素级语义分割可通过利用补充模态(X 模态)的互补特征得以提升。然而,由于不同模态间传感器特性的差异,以模态无关模型覆盖广泛传感器仍是一个未解决的问题。与以往特定模态的方法不同,本文提出一个统一的融合框架 CMX,用于 RGB-X 语义分割。为在不同模态(常包含补充信息及不确定性)间良好泛化,统一的跨模态交互对模态融合至关重要。具体而言,我们设计了跨模态特征校正模块(CM-FRM),通过利用一模态特征校正另一模态特征来校准双模态特征。利用校正后的特征对,我们部署特征融合模块(FFM)以在混合前充分交换长程上下文。为验证 CMX,我们首次统一了五种与 RGB 互补的模态,即深度、热成像、偏振、事件与 LiDAR。大量实验表明 CMX 能很好泛化至多样多模态融合,在五个 RGB-深度基准以及 RGB-热成像、RGB-偏振和 RGB-LiDAR 数据集上取得最先进性能。此外,为探究对稠密-稀疏数据融合的泛化性,我们基于 EventScape 数据集建立了 RGB-事件语义分割基准,CMX 在该基准上刷新了最先进性能。CMX 源代码公开于 https://github.com/huaaaliu/RGBX_Semantic_Segmentation。
引用
@article{arxiv.2203.04838,
title = {CMX: Cross-Modal Fusion for RGB-X Semantic Segmentation with Transformers},
author = {Jiaming Zhang and Huayao Liu and Kailun Yang and Xinxin Hu and Ruiping Liu and Rainer Stiefelhagen},
journal= {arXiv preprint arXiv:2203.04838},
year = {2023}
}
备注
Accepted to IEEE Transactions on Intelligent Transportation Systems (T-ITS). The source code of CMX is publicly available at https://github.com/huaaaliu/RGBX_Semantic_Segmentation