中文

实现任意模态语义分割

计算机视觉与模式识别 2023-03-03 v1

摘要

多模态融合可使语义分割更加鲁棒。然而,融合任意数量的模态仍未被充分探索。为深入研究该问题,我们创建了 DeLiVER 任意模态分割基准,涵盖深度(Depth)、激光雷达(LiDAR)、多视角(multiple Views)、事件(Events)与 RGB。此外,我们在四种恶劣天气条件以及五种传感器失效情形下提供该数据集,以利用模态互补性并解决部分模态中断问题。为此,我们提出任意跨模态分割模型 CMNeXt。它包含自查询枢纽(Self-Query Hub, SQ-Hub),旨在从任意模态中提取有效信息,随后与 RGB 表征融合,且每新增一个模态仅增加可忽略的参数量(约 0.01M)。此外,为高效且灵活地从辅助模态中获取判别性线索,我们引入了简洁的并行池化混合器(Parallel Pooling Mixer, PPX)。通过在共计六个基准上的大量实验,我们的 CMNeXt 在 DeLiVER、KITTI-360、MFNet、NYU Depth V2、UrbanLF 和 MCubeS 数据集上取得了最先进(state-of-the-art)性能,可支持从 1 到 81 个模态的扩展。在最新收集的 DeLiVER 上,四模态 CMNeXt 的 mIoU 达到 66.30%,相比单模态基线提升 9.10%。DeLiVER 数据集与我们的代码见:https://jamycheung.github.io/DELIVER.html。

关键词

引用

@article{arxiv.2303.01480,
  title  = {Delivering Arbitrary-Modal Semantic Segmentation},
  author = {Jiaming Zhang and Ruiping Liu and Hao Shi and Kailun Yang and Simon Reiß and Kunyu Peng and Haodong Fu and Kaiwei Wang and Rainer Stiefelhagen},
  journal= {arXiv preprint arXiv:2303.01480},
  year   = {2023}
}

备注

Accepted by CVPR 2023. Dataset and our code are at: https://jamycheung.github.io/DELIVER.html