中文

从文本到姿态到图像:提升扩散模型的控制能力与生成质量

计算机视觉与模式识别 2024-11-25 v2 人工智能 机器学习

摘要

在过去两年中,文本到图像扩散模型变得极为流行。随着其质量提升和应用普及,一个主要问题是对更好输出控制的需求。除了提示工程外,提升扩散模型可控性的一种有效方法是以图像风格、深度图或关键点等附加模态作为条件。这构成了 ControlNets 或 Adapters 的基础。在尝试将这些方法应用于控制文本到图像扩散模型输出中的人体姿态时,出现了两个主要挑战。第一个挑战是生成符合广泛语义文本描述的姿态,此前的方法需要在(描述,姿态)对数据集中搜索姿态。第二个挑战是在以指定姿态为图像生成条件的同时,保持高美感与高姿态保真度。本文通过引入文本到姿态(T2P)生成模型、一种新的采样算法以及一种结合更多姿态关键点以获得更高姿态保真度的新型姿态适配器,解决了这两个主要问题。这两种新的 SOTA 模型结合在一起,首次实现了一个生成式文本到姿态到图像框架,以在扩散模型中实现更高的姿态控制。我们在 https://github.com/clement-bonnet/text-to-pose 发布了所有模型和实验代码。

关键词

引用

@article{arxiv.2411.12872,
  title  = {From Text to Pose to Image: Improving Diffusion Model Control and Quality},
  author = {Clément Bonnet and Ariel N. Lee and Franck Wertel and Antoine Tamano and Tanguy Cizain and Pablo Ducru},
  journal= {arXiv preprint arXiv:2411.12872},
  year   = {2024}
}

备注

Published at the NeurIPS 2024 Workshop on Compositional Learning: Perspectives, Methods, and Paths Forward