中文

自由式布局到图像合成

计算机视觉与模式识别 2023-03-28 v1

摘要

典型的布局到图像合成(LIS)模型为一组封闭语义类别生成图像,例如 COCO-Stuff 中的 182 个常见对象。在本工作中,我们探索模型的自由式能力,即它能在多大程度上将未见语义(例如类别、属性和风格)生成到给定布局上,并将该任务称为自由式 LIS(FLIS)。得益于大规模预训练语言-图像模型的发展,一些在有限基类别上训练的判别模型(例如图像分类和目标检测)被赋予了未见类别预测的能力。受此启发,我们选择利用大规模预训练文本到图像扩散模型来实现未见语义的生成。FLIS 的关键挑战在于如何使扩散模型从特定布局合成图像,而该布局极有可能违背其预学习知识,例如模型在预训练期间从未见过“一只独角兽坐在长椅上”。为此,我们引入一个名为修正交叉注意力(Rectified Cross-Attention, RCA)的新模块,可便捷地插入扩散模型以整合语义掩码。该“插件”应用于模型的每个交叉注意力层,以修正图像与文本词元之间的注意力图。RCA 的关键思想是强制每个文本词元作用于指定区域内的像素,使我们能将来自预训练知识(通用的)的广泛语义自由地放置到给定布局(特定的)上。大量实验表明,所提出的扩散网络可生成具有多样文本输入的真实且自由式的布局到图像结果,具有催生一系列有趣应用的高潜力。代码见 https://github.com/essunny310/FreestyleNet。

关键词

引用

@article{arxiv.2303.14412,
  title  = {Freestyle Layout-to-Image Synthesis},
  author = {Han Xue and Zhiwu Huang and Qianru Sun and Li Song and Wenjun Zhang},
  journal= {arXiv preprint arXiv:2303.14412},
  year   = {2023}
}

备注

Accepted to CVPR 2023