增强布局到图像合成中的物体一致性
计算机视觉与模式识别
2025-04-01 v7 人工智能
摘要
布局到图像合成是条件图像生成中的一项新兴技术。其旨在生成复杂场景,其中用户需要对场景中物体的布局进行精细控制。然而,控制物体一致性(包括语义一致性(如猫是否看向花朵)与物理一致性(如手与球拍不应错位))仍具挑战。本文提出一种新颖的扩散模型,带有有效的全局语义融合(GSF)与自相似特征增强模块,以引导该任务的物体一致性。对于语义一致性,我们认为图像描述包含丰富信息用于定义图像中物体间的语义关系。不同于简单地采用描述与潜图像间的交叉注意力(其将高度相关的布局约束与语义一致性需求分开处理,从而导致如我们实验所示的不尽人意的结果),我们开发了GSF来融合来自布局约束与语义一致性需求的监督,并利用其引导图像合成过程。此外,为改善物理一致性,我们开发了自相似一致性注意力(SCA)模块,将局部上下文物理一致性关系显式整合进每个像素的生成过程。具体而言,我们采用自相似图编码物理一致性约束,并用以从文本嵌入中提取一致特征。通过对自相似图的可视化,我们探究了SCA的本质,揭示其有效性不仅在于捕捉可靠的物理一致性模式,也在于增强复杂纹理生成。大量实验证明了我们所提方法的优越性。
引用
@article{arxiv.2311.10522,
title = {Enhancing Object Coherence in Layout-to-Image Synthesis},
author = {Yibin Wang and Changhai Zhou and Honghui Xu},
journal= {arXiv preprint arXiv:2311.10522},
year = {2025}
}
备注
Code: https://github.com/CodeGoat24/EOCNet