Att-Adapter:基于条件变分自编码器的鲁棒且精确的领域特定多属性T2I扩散适配器
计算机视觉与模式识别
2025-07-25 v4 人工智能
摘要
文本到图像(T2I)扩散模型在生成高质量图像方面已取得显著成就。然而,在新领域(如眼开度或车宽等数值型属性)中,仅通过文本引导实现对连续属性的精确控制,尤其是同时控制多个属性,仍然是一个重大挑战。为此,我们提出了Att-Adapter(属性适配器),一种新颖的即插即用模块,旨在使预训练扩散模型能够实现细粒度的多属性控制。我们的方法从一组可无配对且包含多个视觉属性的样本图像中学习单个控制适配器。Att-Adapter利用解耦交叉注意力模块,自然地协调多个领域属性与文本条件。我们进一步在Att-Adapter中引入条件变分自编码器(CVAE)以缓解过拟合,匹配视觉世界的多样性。在两个公开数据集上的评估表明,Att-Adapter在控制连续属性方面优于所有基于LoRA的基线。此外,我们的方法实现了更广泛的控制范围,并改善了多属性之间的解耦,超越了基于StyleGAN的技术。值得注意的是,Att-Adapter具有灵活性,无需配对的合成数据进行训练,并且可以轻松扩展到单模型中的多个属性。
引用
@article{arxiv.2503.11937,
title = {Att-Adapter: A Robust and Precise Domain-Specific Multi-Attributes T2I Diffusion Adapter via Conditional Variational Autoencoder},
author = {Wonwoong Cho and Yan-Ying Chen and Matthew Klenk and David I. Inouye and Yanxia Zhang},
journal= {arXiv preprint arXiv:2503.11937},
year = {2025}
}
备注
ICCV'25 (Highlight), The project page is available at https://tri-mac.github.io/att-adapter/