MFTF:基于掩码-free 的训练-free 对象级布局控制扩散模型
计算机视觉与模式识别
2024-12-19 v2 人工智能
摘要
文本到图像生成模型已彻底变革了内容创建,但基于扩散的视觉语言模型在仅通过文本指导实现对生成图像中物体形状、外观和位置的精确控制方面仍面临挑战。现有的全局图像编辑模型依赖额外的掩码或图像作为指导以实现布局控制,常需重新训练模型。而局部对象编辑模型虽允许修改物体形状,却缺乏控制物体位置的能力。为此,我们提出了一种名为 Mask-free Training-free Object-Level Layout Control Diffusion Model(掩码-free 训练-free 对象级布局控制扩散模型)的方案,通过无需额外掩码或图像即可实现对物体位置的精确控制。该模型支持单对象和多对象的位置调整,如平移和旋转,同时实现布局控制与对象语义编辑的同步进行。MFTF 模型采用源扩散模型和目标扩散模型的并行去噪过程。在此过程中,来自源扩散模型的跨注意力层动态生成注意力掩码,并应用于自注意力层的查询,以隔离物体。这些查询在源扩散模型中生成后,根据布局控制参数进行调整,并重新注入目标扩散模型的自注意力层。这种方法确保了对物体位置的准确且精确的控制。项目源码可在 https://github.com/syang-genai/MFTF 查看。
引用
@article{arxiv.2412.01284,
title = {MFTF: Mask-free Training-free Object Level Layout Control Diffusion Model},
author = {Shan Yang},
journal= {arXiv preprint arXiv:2412.01284},
year = {2024}
}
备注
8 pages, 7 figures