用于生成富有表现力的对象的部件组合
计算机视觉与模式识别
2025-07-01 v2 人工智能
机器学习
摘要
图像组合与生成是艺术家需要对生成图像的各个部分进行控制的过程。然而,当前的生成模型(如 Stable Diffusion)无法处理文本提示中细粒度的部件属性。具体来说,当向基础文本提示添加额外的属性细节时,这些文本到图像模型要么会生成与基础提示生成的图像截然不同的图像,要么会忽略这些属性细节。为缓解这些问题,我们引入 PartComposer,这是一个无训练方法,使图像生成能够基于对象在基础文本提示中指定的细粒度部件属性进行控制。这为艺术家提供了更多的控制选项,并通过组合具有不同特征的部件来实现新颖的对象组合。PartComposer 首先通过去噪来局部化对象区域,从而将每个部件标记局部化到正确的区域。获得部件掩码后,我们在每个部件区域内基于细粒度部件属性进行局部扩散过程,并将其组合以生成最终图像。PartComposer 的所有阶段都基于对预训练扩散模型的重新利用而实现,这使其能够跨域泛化。我们通过定性视觉示例和与当代基线方法的定量比较,展示了 PartComposer 提供的部件级控制的有效性。
引用
@article{arxiv.2406.10197,
title = {Composing Parts for Expressive Object Generation},
author = {Harsh Rangwani and Aishwarya Agarwal and Kuldeep Kulkarni and R. Venkatesh Babu and Srikrishna Karanam},
journal= {arXiv preprint arXiv:2406.10197},
year = {2025}
}
备注
Project Page Will Be Here: https://rangwani-harsh.github.io/PartCraft