中文

面向显著物体检测的多尺度细节增强分段模型

计算机视觉与模式识别 2024-08-09 v1 多媒体

摘要

显著物体检测(SOD)旨在识别和分割图像中最突出的物体。高级SOD方法常利用 various 卷积神经网络(CNN)或 Transformer 进行深度特征提取。然而,这些方法在复杂情形下仍表现低下且泛化性差。最近,分段模型(Segment Anything Model, SAM)被提出作为一种视觉基础模型,具有强大的分割和泛化能力。然而,SAM需要准确的目标物体提示,而SOD中这些提示不可用。此外,SAM未能充分利用多尺度和多层次信息,也未融入细粒度细节。为解决这些问题,本文提出了一种用于SOD的多尺度细节增强SAM(Multi-scale and Detail-enhanced SAM, MDSAM)。具体而言,我们首先引入轻量级多尺度适配器(LMSA),使SAM能够以极少的可训练参数学习多尺度信息。随后,我们提出多层次融合模块(MLFM)来全面利用SAM编码器中的多层次信息。最后,我们提出细节增强模块(DEM)将SAM与细粒度细节相结合。实验结果表明,我们的模型在多个SOD数据集上表现优异,并在其他分割任务中展现出强大的泛化能力。源码已发布于 https://github.com/BellyBeauty/MDSAM。

关键词

引用

@article{arxiv.2408.04326,
  title  = {Multi-Scale and Detail-Enhanced Segment Anything Model for Salient Object Detection},
  author = {Shixuan Gao and Pingping Zhang and Tianyu Yan and Huchuan Lu},
  journal= {arXiv preprint arXiv:2408.04326},
  year   = {2024}
}

备注

This work is accepted by ACM MM2024