中文

通过域适应在文本到图像扩散模型中控制人体形状与姿态

计算机视觉与模式识别 2024-11-08 v1

摘要

我们提出了一种利用三维人体参数化模型(SMPL)在预训练文本到图像扩散模型中进行条件化控制人体形状与姿态的方法。对这些扩散模型进行微调以满足新条件需要大规模数据集和高质量标注,而这些数据可以通过合成数据生成而非真实世界数据以更具成本效益的方式获取。然而,合成数据的域差距和场景多样性不足可能损害预训练模型的视觉保真度。我们提出了一种域适应技术,通过在无分类器引导向量中隔离合成训练的条件信息,并将其与另一个控制网络组合,使生成的图像适应输入域,从而保持图像质量。为实现 SMPL 控制,我们在合成 SURREAL 数据集上微调了基于 ControlNet 的架构,并在生成时应用我们的域适应方法。实验表明,我们的模型在保持视觉保真度和提升稳定性的同时,比基于二维姿态的 ControlNet 实现了更大的人体形状与姿态多样性,证明了其在人类动画等下游任务中的实用性。

关键词

引用

@article{arxiv.2411.04724,
  title  = {Controlling Human Shape and Pose in Text-to-Image Diffusion Models via Domain Adaptation},
  author = {Benito Buchheim and Max Reimann and Jürgen Döllner},
  journal= {arXiv preprint arXiv:2411.04724},
  year   = {2024}
}