基于双提示学习的高效多模态语义分割
计算机视觉与模式识别
2023-12-05 v2
摘要
多模态(如 RGB-深度/RGB-热)融合在复杂场景(如室内/低光照条件)中改进语义分割已展现出巨大潜力。现有方法通常为实现多模态语义分割而完全微调双分支编码器-解码器框架并采用复杂的特征融合策略,由于特征提取与融合中大量的参数更新而导致训练成本高昂。为解决此问题,我们提出了一种令人惊讶地简单却有效的双提示学习网络(称为 DPLNet),用于训练高效的多模态(如 RGB-D/T)语义分割。DPLNet 的核心是将冻结的预训练 RGB 模型直接适配到多模态语义分割,减少参数更新。为此,我们提出了两个提示学习模块,包括多模态提示生成器(MPG)和多模态特征适配器(MFA)。MPG 以紧凑方式融合来自不同模态的特征,并从浅层插入到深层阶段以生成注入冻结主干的多级多模态提示,而 MFA 适配冻结主干中被提示的多模态特征以获得更好的多模态语义分割。由于 MPG 和 MFA 均为轻量级,仅引入了少量可训练参数(3.88M,占预训练主干参数的 4.4%)用于多模态特征融合与学习。使用一个简单的解码器(3.27M 参数),DPLNet 在四个 RGB-D/T 语义分割数据集上取得了新的最先进性能或与其它复杂方法相当,同时满足参数高效性。此外,我们展示了 DPLNet 具有通用性,可应用于其它多模态任务,如显著目标检测和视频语义分割。无需特殊设计,DPLNet 优于许多复杂模型。我们的代码将发布于 github.com/ShaohuaDong2021/DPLNet。
引用
@article{arxiv.2312.00360,
title = {Efficient Multimodal Semantic Segmentation via Dual-Prompt Learning},
author = {Shaohua Dong and Yunhe Feng and Qing Yang and Yan Huang and Dongfang Liu and Heng Fan},
journal= {arXiv preprint arXiv:2312.00360},
year = {2023}
}
备注
11 pages, 4 figures, 9 tables