中文

LD-ZNet:一种基于潜在扩散的文本图像分割方法

计算机视觉与模式识别 2023-08-25 v2

摘要

大规模预训练任务如图像分类、图像描述或自监督技术并不激励学习物体的语义边界。然而,近期使用基于文本的潜在扩散技术构建的生成基础模型可能学习到语义边界。这是因为它们必须基于文本描述合成图像中所有物体的精细细节。因此,我们提出一种利用在互联网规模数据集上训练的潜在扩散模型(LDMs)分割真实与 AI 生成图像的技术。首先,我们表明 LDMs 的潜在空间(z-space)相较于 RGB 图像或 CLIP 编码等其他特征表示,是文本图像分割更好的输入表示。通过在潜在 z-space 上训练分割模型(其跨多种域如不同形式的艺术、卡通、插画与照片创建压缩表示),我们也能够弥合真实与 AI 生成图像间的域差距。我们表明 LDMs 的内部特征包含丰富语义信息,并提出以 LD-ZNet 形式的技术进一步提升文本分割性能。总体上,我们在自然图像上文本到图像分割的标准基线之上显示出高达 6% 的提升。对于 AI 生成图像,我们显示出相较最先进(sota)技术接近 20% 的提升。项目地址:https://koutilya-pnvr.github.io/LD-ZNet/。

关键词

引用

@article{arxiv.2303.12343,
  title  = {LD-ZNet: A Latent Diffusion Approach for Text-Based Image Segmentation},
  author = {Koutilya Pnvr and Bharat Singh and Pallabi Ghosh and Behjat Siddiquie and David Jacobs},
  journal= {arXiv preprint arXiv:2303.12343},
  year   = {2023}
}

备注

Supplementary material is included in the paper following the references section