PLACE:用于语义图像合成的自适应布局 - 语义融合
计算机视觉与模式识别
2024-03-05 v1
摘要
大规模预训练文本到图像模型的最新进展推动了语义图像合成的显著进步。然而,合成具有连贯语义和布局的高质量图像仍然是一个挑战。在本文中,我们提出了自适应布局 - 语义融合模块(PLACE),利用预训练模型来缓解上述问题。具体而言,我们首先利用布局控制图在特征空间中忠实地表示布局。随后,我们以时间步自适应的方式结合布局和语义特征,合成具有真实细节的图像。在微调过程中,我们提出了语义对齐(SA)损失以进一步增强布局对齐。此外,我们引入了无布局先验保持(LFP)损失,利用未标记数据保持预训练模型的先验,从而提高合成图像的视觉质量和语义一致性。大量实验表明,我们的方法在视觉质量、语义一致性和布局对齐方面表现优异。源代码和模型可在 https://github.com/cszy98/PLACE/tree/main 获取。
引用
@article{arxiv.2403.01852,
title = {PLACE: Adaptive Layout-Semantic Fusion for Semantic Image Synthesis},
author = {Zhengyao Lv and Yuxiang Wei and Wangmeng Zuo and Kwan-Yee K. Wong},
journal= {arXiv preprint arXiv:2403.01852},
year = {2024}
}