中文

DFormer:用于通用图像分割的扩散引导Transformer

计算机视觉与模式识别 2023-06-09 v2

摘要

本文介绍了一种名为 DFormer 的通用图像分割方法。所提出的 DFormer 将通用图像分割任务视为使用扩散模型的去噪过程。DFormer 首先向真实掩码添加不同级别的高斯噪声,然后学习一个模型从损坏的掩码中预测去噪掩码。具体而言,我们将深度像素级特征与噪声掩码一起作为输入来生成掩码特征和注意力掩码,采用基于扩散的解码器逐步执行掩码预测。在推理时,我们的 DFormer 直接从一组随机生成的掩码预测掩码及相应类别。大量实验揭示了我们所提贡献在不同图像分割任务上的优势:全景分割、实例分割和语义分割。我们的 DFormer 在 MS COCO val2017 集上以 3.6% 的优势优于最近的基于扩散的全景分割方法 Pix2Seq-D。此外,DFormer 取得了有前景的语义分割性能,在 ADE20K val 集上以 2.2% 优于最近的基于扩散的方法。我们的源代码和模型将公开于 https://github.com/cp3wan/DFormer

关键词

引用

@article{arxiv.2306.03437,
  title  = {DFormer: Diffusion-guided Transformer for Universal Image Segmentation},
  author = {Hefeng Wang and Jiale Cao and Rao Muhammad Anwer and Jin Xie and Fahad Shahbaz Khan and Yanwei Pang},
  journal= {arXiv preprint arXiv:2306.03437},
  year   = {2023}
}

备注

Project website: https://github.com/cp3wan/DFormer