中文

OmniSegmentor:面向语义分割的灵活多模态学习框架

计算机视觉与模式识别 2025-09-19 v1

摘要

近期研究表明,多模态线索对稳健语义分割具有重要价值。然而,针对多种视觉模态的灵活的预训练-微调管道仍未得到探索。本文提出一种新型多模态学习框架,称为OmniSegmentor。其包含两个关键创新:1)基于ImageNet,我们构建了一个大规模多模态预训练数据集,称为ImageNeXt,其中包含五种流行的视觉模态。2)我们提供了一种高效预训练方式,使模型能够在ImageNeXt中编码不同模态信息。首次引入一种通用多模态预训练框架,无论涉及的模态组合如何,均能持续放大模型的感知能力。在广泛的多模态语义分割数据集上,OmniSegmentor实现了新的状态突破,包括NYU Depthv2、EventScape、MFNet、DeLiVER、SUNRGBD和KITTI-360。

关键词

引用

@article{arxiv.2509.15096,
  title  = {OmniSegmentor: A Flexible Multi-Modal Learning Framework for Semantic Segmentation},
  author = {Bo-Wen Yin and Jiao-Long Cao and Xuying Zhang and Yuming Chen and Ming-Ming Cheng and Qibin Hou},
  journal= {arXiv preprint arXiv:2509.15096},
  year   = {2025}
}

备注

Accepted by NeurIPS 2025