训练-free 稠密对齐扩散引导用于模块化条件图像合成
计算机视觉与模式识别
2025-04-21 v2 人工智能
摘要
条件图像合成是具有广泛应用场景的关键任务,如艺术创作和虚拟现实。然而,当前的生成方法往往是任务导向的,作用范围有限,仅能处理受限的条件且适用性受限。本文提出了一种新方法,将条件图像合成视为多种基本条件单元的模块化组合。具体而言,我们将条件分为三类基本单元:文本、布局和拖拽。为实现对这些条件的有效控制,我们为每种条件设计了一个专用的对齐模块。对于文本条件,我们引入稠密概念对齐(Dense Concept Alignment, DCA)模块,通过借鉴多样化的文本概念实现稠密视觉-文本对齐。对于布局条件,我们提出稠密几何对齐(Dense Geometry Alignment, DGA)模块,以确保几何约束全面且保留空间配置。对于拖拽条件,我们引入稠密运动对齐(Dense Motion Alignment, DMA)模块,应用多层次运动正则化,确保每个像素都遵循其预期轨迹且无视觉瑕疵。通过灵活插入和组合这些对齐模块,我们的框架增强了模型对多样化条件生成任务的适应性,大大扩展了其应用范围。大量实验表明,我们的框架在包括文本描述、分割掩码(边界框)、拖拽操作及其组合等多种条件下均表现优异。代码已公开于 https://github.com/ZixuanWang0525/DADG。
引用
@article{arxiv.2504.01515,
title = {Training-free Dense-Aligned Diffusion Guidance for Modular Conditional Image Synthesis},
author = {Zixuan Wang and Duo Peng and Feng Chen and Yuwei Yang and Yinjie Lei},
journal= {arXiv preprint arXiv:2504.01515},
year = {2025}
}
备注
Accepted by CVPR2025