中文

iSeg:基于迭代精炼的无训练分割框架

计算机视觉与模式识别 2024-10-10 v4

摘要

Stable diffusion 展现出根据给定文本描述合成图像的强大能力,表明其包含用于对物体进行分组的强语义线索。研究人员已探索将 stable diffusion 用于无训练分割。大多数现有方法利用自注意力图对交叉注意力图进行一次精炼,表明自注意力图包含可用于改善分割的有用语义信息。为充分利用自注意力图,我们对利用自注意力图迭代精炼交叉注意力图进行了深入的实验分析,并提出了一种有效的无训练分割迭代精炼框架,命名为 iSeg。所提出的 iSeg 引入了一个降熵自注意力模块,该模块利用梯度下降方案降低自注意力图的熵,从而抑制与无关全局信息对应的弱响应。借助降熵自注意力模块,我们的 iSeg 通过迭代精炼稳定地改进了精炼后的交叉注意力图。此外,我们设计了一个类别增强交叉注意力模块以生成准确的交叉注意力图,为迭代精炼提供更好的初始输入。在不同数据集和多种分割任务上的大量实验揭示了所提贡献的优势,在多种分割任务上取得了有前景的性能。在 Cityscapes 的无监督语义分割上,与文献中现有的最佳无训练方法相比,我们的 iSeg 在 mIoU 上实现了 3.8% 的绝对增益。此外,我们提出的 iSeg 可支持不同类型图像和交互的分割。项目主页见 https://linsun449.github.io/iSeg。

关键词

引用

@article{arxiv.2409.03209,
  title  = {iSeg: An Iterative Refinement-based Framework for Training-free Segmentation},
  author = {Lin Sun and Jiale Cao and Jin Xie and Fahad Shahbaz Khan and Yanwei Pang},
  journal= {arXiv preprint arXiv:2409.03209},
  year   = {2024}
}

备注

Project Page: https://linsun449.github.io/iSeg/ Code: https://github.com/linsun449/iseg.code