基于文本到图像扩散模型的开放词汇全景分割
计算机视觉与模式识别
2023-04-06 v4
摘要
我们提出 ODISE:基于开放词汇扩散的全景分割(Open-vocabulary DIffusion-based panoptic SEgmentation),其统一了预训练的文本-图像扩散模型与判别模型来执行开放词汇全景分割。文本到图像扩散模型具有以多样化开放词汇语言描述生成高质量图像的卓越能力,这表明其内部分表示空间与真实世界中的开放概念高度相关。另一方面,像 CLIP 这样的文本-图像判别模型擅长将图像分类为开放词汇标签。我们利用这两种模型的冻结内部表示来执行野外任意类别的全景分割。我们的方法在开放词汇全景分割和语义分割任务上均以显著优势超越先前的最先进水平(SOTA)。特别地,仅使用 COCO 训练,我们的方法在 ADE20K 数据集上取得了 23.4 PQ 和 30.0 mIoU,相对先前最先进水平分别绝对提升 8.3 PQ 和 7.9 mIoU。我们在 https://github.com/NVlabs/ODISE 开源了代码和模型。
引用
@article{arxiv.2303.04803,
title = {Open-Vocabulary Panoptic Segmentation with Text-to-Image Diffusion Models},
author = {Jiarui Xu and Sifei Liu and Arash Vahdat and Wonmin Byeon and Xiaolong Wang and Shalini De Mello},
journal= {arXiv preprint arXiv:2303.04803},
year = {2023}
}
备注
CVPR 2023 Highlight. Project page and code: https://jerryxu.net/ODISE