通过识别语义方向实现T2I模型中连续且特定于主体的属性控制
计算机视觉与模式识别
2025-03-17 v2 人工智能
机器学习
摘要
文本到图像(T2I)扩散模型的最新进展显著提高了生成图像的质量。然而,对单个主体,特别是表征它们的属性提供高效控制,仍然是一个关键挑战。虽然现有方法引入了调节属性表达的机制,但它们通常要么提供此类修改的详细的、特定于对象的定位,要么提供全尺度细粒度的、细微的属性控制。目前没有方法能同时提供两者,导致在图像生成中实现精确的连续且特定于主体的属性调节时存在空白。在这项工作中,我们证明了在常用的CLIP文本嵌入中存在token级别的方向,能够在T2I模型中实现对高层属性的细粒度、特定于主体的控制。我们引入了两种方法来识别这些方向:一种简单的、无需优化的技术,以及一种利用T2I模型更具体地表征语义概念的基于学习的方法。我们的方法允许对提示文本输入进行增强,能够同时控制单个主体的多个属性,而无需对扩散模型本身进行任何修改。这种方法提供了一个统一的解决方案,填补了全局控制和局部控制之间的空白,在文本引导的图像生成中提供了具有竞争力的灵活性和精度。项目页面:https://compvis.github.io/attribute-control。代码可在https://github.com/CompVis/attribute-control获取。
引用
@article{arxiv.2403.17064,
title = {Continuous, Subject-Specific Attribute Control in T2I Models by Identifying Semantic Directions},
author = {Stefan Andreas Baumann and Felix Krause and Michael Neumayr and Nick Stracke and Melvin Sevi and Vincent Tao Hu and Björn Ommer},
journal= {arXiv preprint arXiv:2403.17064},
year = {2025}
}
备注
CVPR 2025. Project page: https://compvis.github.io/attribute-control