可控图像合成中的对象保留:Preserve Anything
计算机视觉与模式识别
2025-07-28 v2
摘要
我们提出了 \textit{Preserve Anything},一种用于受控图像合成的 novel 方法,旨在解决对象保留和语义一致性在文本到图像(T2I)生成中的关键局限性。现有方法常常无法做到(1)精确保留多个对象,(2)保持与提示的语义对齐,或(3)提供对场景构图的显式控制。为克服这些挑战,本方法采用包含(1)对象保留(具备大小和位置不确定性、颜色和细节保留以及消除伪影)、(2)高分辨率、语义一致的背景(包括准确的阴影、光照以及提示一致性)以及(3)对背景布局和光照条件的显式用户控制的 N 通道 ControlNet。我们的框架包括对象保留和背景引导模块,确保光照一致性以及高频叠加模块以保留细节并减轻不必要的伪影。我们引入了一个包含 24 万张筛选出的天然图像(用于审美质量)和 1.8 万张带有光照、摄像机视角以及对象关系等元数据的 3D 渲染合成图像的数据集。该数据集弥补了现有基准的不足,允许完整评估。实证结果表明,我们的方法实现了最先进的性能,在特征空间保真度(FID 15.26)和语义对齐度(CLIP-S 32.85)方面显著提升,同时保持具竞争力的审美质量。我们还进行了用户研究,以在未看到的基准数据集上验证所提工作,发现其在提示对齐、照片 realism、AI 伪影消除以及自然审美方面分别提升约 25%、19%、13% 和 14%。
引用
@article{arxiv.2506.22531,
title = {Preserve Anything: Controllable Image Synthesis with Object Preservation},
author = {Prasen Kumar Sharma and Neeraj Matiyali and Siddharth Srivastava and Gaurav Sharma},
journal= {arXiv preprint arXiv:2506.22531},
year = {2025}
}
备注
Accepted at ICCV 2025 (main conference)