中文

潜入水下:基于分割一切模型的水下显著实例分割与大规模数据集

计算机视觉与模式识别 2025-05-28 v1

摘要

随着大模型的突破,分割一切模型(SAM)及其扩展已被尝试应用于计算机视觉的多种任务。水下显著实例分割是各种水下视觉任务的基础且关键的一步,但由于复杂的水下环境和模型的适应能力,该任务常常面临分割精度低的问题。此外,缺乏具有像素级显著实例标注的大规模数据集阻碍了机器学习技术在该领域的发展。为解决这些问题,我们构建了首个大规模水下显著实例分割数据集(USIS10K),该数据集包含来自各种水下场景的10,632张水下图像,具有7个类别的像素级标注。然后,我们提出了一种专门针对水下领域的、基于分割一切模型的水下显著实例分割架构(USIS-SAM)。我们设计了一个水下自适应视觉变换器(UA-ViT)编码器,将水下领域视觉提示融入分割网络。我们进一步设计了一个即插即用的水下显著特征提示生成器(SFPG),以自动生成显著提示,而不是像SAM那样显式地提供前景点或框作为提示。全面的实验结果表明,与最先进的方法相比,我们的USIS-SAM方法在USIS10K数据集上能够实现优越的性能。数据集和代码已在 https://github.com/LiamLian0727/USIS10K 上发布。

关键词

引用

@article{arxiv.2406.06039,
  title  = {Diving into Underwater: Segment Anything Model Guided Underwater Salient Instance Segmentation and A Large-scale Dataset},
  author = {Shijie Lian and Ziyi Zhang and Hua Li and Wenjie Li and Laurence Tianruo Yang and Sam Kwong and Runmin Cong},
  journal= {arXiv preprint arXiv:2406.06039},
  year   = {2025}
}

备注

Accepted to ICML 2024, Code released at: https://github.com/LiamLian0727/USIS10K