跳过-播放:基于深度的任意对象姿态保持图像生成
计算机视觉与模式识别
2024-09-05 v1
摘要
扩散模型的出现使得仅凭文本即可生成多样化的高质量图像成为可能,随后也有不断的努力去提升这些模型的可控性。尽管在可控性方面取得了改进,但姿态控制仍然仅限于特定对象(如人类)或特定姿态(如正面视角),因为姿态通常是通过相机参数(如旋转角度)或关键点(如眼睛、鼻子)来控制的。具体而言,基于相机参数的姿态控制模型会因训练所用的3D数据集较小而生成取决于对象的不真实图像。此外,基于关键点的方法在获取各种对象(如教堂)或特定姿态(如背面视角)的可靠关键点方面面临挑战。为此,我们提出基于深度的姿态控制方法,因为深度图可以由单一的深度估计模型轻松获取,且不受对象和姿态的限制,不同于相机参数和关键点。然而,基于深度的姿态控制面临着与形状相关的问题,因为深度图不仅影响生成图像的姿态,也影响其形状。为解决此问题,我们提出了跳过-播放(Skip-and-Play, SnP)方法,通过分析深度条件ControlNet三个组成部分对生成图像姿态和形状的影响。在分析结果基础上,我们有选择地跳过部分组成部分,以减轻深度图对形状的依赖,同时保持姿态。通过各种实验,我们展示了SnP在基线方法之上具有优势,并展示了SnP能够生成多样化对象和姿态的能力。值得注意的是,SnP能够在条件对象(如马)与提示(如刺猬)彼此不同时,生成相应的图像。
关键词
引用
@article{arxiv.2409.02653,
title = {Skip-and-Play: Depth-Driven Pose-Preserved Image Generation for Any Objects},
author = {Kyungmin Jo and Jaegul Choo},
journal= {arXiv preprint arXiv:2409.02653},
year = {2024}
}