风格化分割:基于 StyleGAN 与 CLIP 的无监督语义图像分割
计算机视觉与模式识别
2021-11-22 v2
摘要
我们提出一种无需人类监督即可自动将图像分割为语义有意义区域的方法。所得区域在不同图像间保持一致,并在某些数据集上与人类定义的语义类别吻合。在语义区域难以由人类定义并一致标注的情况下,我们的方法仍能够发现有意义且一致的语义类别。在我们的工作中,我们使用预训练的 StyleGAN2 生成模型:在生成模型的特征空间中聚类可发现语义类别。一旦类别被发现,便可创建一个包含生成图像及对应分割掩码的合成数据集。此后,一个分割模型在该合成数据集上训练,并能够泛化到真实图像。此外,通过使用 CLIP,我们可利用自然语言定义的提示来发现某些期望的语义类别。我们在公开数据集上测试了我们的方法,并展示了最先进的结果。
引用
@article{arxiv.2107.12518,
title = {Segmentation in Style: Unsupervised Semantic Image Segmentation with Stylegan and CLIP},
author = {Daniil Pakhomov and Sanchit Hira and Narayani Wagle and Kemar E. Green and Nassir Navab},
journal= {arXiv preprint arXiv:2107.12518},
year = {2021}
}
备注
https://segmentation-in-style.github.io/