对抗性监督让布局到图像扩散模型蓬勃发展
计算机视觉与模式识别
2024-01-18 v1 人工智能
机器学习
摘要
尽管大规模扩散模型近期取得了进展,但布局到图像(L2I)合成任务进展甚微。当前的L2I模型要么通过文本的可编辑性差,要么生成的图像与输入布局之间的对齐性弱。这限制了它们在实践中的可用性。为了缓解这一问题,我们提出将对抗性监督集成到L2I扩散模型(ALDM)的传统训练流程中。具体而言,我们采用了一个基于分割的判别器,它为扩散生成器提供了关于去噪图像与输入布局之间像素级对齐的显式反馈。为了鼓励在采样步骤中持续遵循输入布局,我们进一步引入了多步展开策略。我们不是只看单个时间步,而是递归地展开几步来模拟推理过程,并要求判别器评估在一定时间窗口内去噪图像与布局的对齐情况。我们的实验表明,ALDM能够实现生成图像的布局忠实性,同时允许通过文本提示进行广泛的编辑。此外,我们展示了其在实践应用中的有用性:通过文本控制合成目标分布样本,我们将语义分割模型的领域泛化能力大幅提高了约12 mIoU点。
引用
@article{arxiv.2401.08815,
title = {Adversarial Supervision Makes Layout-to-Image Diffusion Models Thrive},
author = {Yumeng Li and Margret Keuper and Dan Zhang and Anna Khoreva},
journal= {arXiv preprint arXiv:2401.08815},
year = {2024}
}
备注
Accepted at ICLR 2024. Project page: https://yumengli007.github.io/ALDM/ and code: https://github.com/boschresearch/ALDM