中文

通过自适应提示学习实现统一模态显著性目标检测

计算机视觉与模式识别 2024-06-06 v5

摘要

现有的单模态与多模态显著性目标检测(SOD)方法侧重于为其各自任务设计特定架构。然而,为不同任务开发完全不同的模型会导致人力与时间消耗,以及高昂的计算与实际部署成本。本文中,我们试图在一个称为 UniSOD 的统一框架中解决单模态与多模态 SOD,其充分利用不同任务间重叠的先验知识。尽管如此,为模态可变输入分配适当策略颇具挑战。为此,UniSOD 通过自适应提示学习以任务特定提示学习模态感知提示,将其插入所提出的预训练基线 SOD 模型中以处理相应任务,同时仅需相比训练整个模型更少的可学习参数。每个模态感知提示由可切换提示生成块生成,其基于单模态与多模态输入自适应执行结构切换而无需人工干预。通过端到端联合训练,UniSOD 在 RGB、RGB-D 和 RGB-T SOD 的 14 个基准数据集上实现了整体性能提升,表明我们的方法有效且高效地统一了单模态与多模态 SOD 任务。代码与结果见 https://github.com/Angknpng/UniSOD。

关键词

引用

@article{arxiv.2311.16835,
  title  = {Unified-modal Salient Object Detection via Adaptive Prompt Learning},
  author = {Kunpeng Wang and Chenglong Li and Zhengzheng Tu and Zhengyi Liu and Bin Luo},
  journal= {arXiv preprint arXiv:2311.16835},
  year   = {2024}
}

备注

13 pages, 11 figures