中文

面向任意模态的语义分割模态无关表示学习

计算机视觉与模式识别 2024-07-17 v1

摘要

图像模态在 certain 条件下往往难以实现,例如夜间或快速运动。这显著限制了现有多模态 (即图像+X) 语义分割方法在遭遇模态缺失或失效时的鲁棒性和灵活性,尽管在实际应用中常见。灵感来自多模态视觉语言模型 (MVLMs) 的开放世界学习能力,我们探索一种通过知识蒸馏 (KD) 从 MVLMs 学习模态无关表示的新思路。具体而言,我们提出了 Any2Seg,一个 novel 框架,可实现来自任何视觉条件下任意模态组合的稳健分割。具体来说,我们首先引入一种 novel 语言引导语义相关蒸馏 (LSCD) 模块,从 MVLMs (例如 LanguageBind) 中传递双模态和单模态语义知识,置于嵌入空间。这使我们能够最小化模态间隙,缓解语义歧义,以任意视觉条件下组合任意模态。随后,我们引入一种模态无关特征融合 (MFF) 模块,根据模态间相关性对多模态特征进行重新加权,并选择精细特征。如此,Any2Seg 最终产生最佳模态无关表示。在两个基准数据集上进行的大量实验表明,Any2Seg 在多模态设置下 (+3.54 mIoU) 实现了最先进水平,并在具有挑战性的模态不完整设置下 (+19.79 mIoU) 表现出色。

关键词

引用

@article{arxiv.2407.11351,
  title  = {Learning Modality-agnostic Representation for Semantic Segmentation from Any Modalities},
  author = {Xu Zheng and Yuanhuiyi Lyu and Lin Wang},
  journal= {arXiv preprint arXiv:2407.11351},
  year   = {2024}
}

备注

Accepted to ECCV 2024