基于 GUNet 的图卷积网络统一扩散模型用于稳定且多样的姿态生成
机器人学
2024-09-19 v1 计算机视觉与模式识别
摘要
姿态骨架图像是姿态可控图像生成中的重要参考。为了丰富骨架图像的来源,最近的研究人员探索了基于自然语言生成姿态骨架的方法。这些方法基于 GAN。然而,要实现基于各种文本输入的多样、结构正确且审美良好的人体姿态骨架生成仍然具有挑战。为此,我们提出了一个以 GUNet 为主要模型的框架,即 PoseDiffusion。这第一个基于扩散模型的生成框架,也包含一系列基于稳定扩散模型进行微调的变体。PoseDiffusion 在多个方面表现出优于现有方法的所需属性。1)正确的骨架。GUNet 作为 PoseDiffusion 的去噪模型,被设计为包含图卷积神经网络,能够通过在训练过程中引入骨架信息来学习人体骨架的空间关系。2)多样性。我们将关键点解耦并分别对其进行特征化,使用跨注意力引入文本条件。实验结果表明,PoseDiffusion 在文本驱动的姿态骨架生成稳定性和多样性方面优于现有的 SoTA 方法。定性分析进一步显示其在 Stable Diffusion 中的可控生成方面的优势。
引用
@article{arxiv.2409.11688,
title = {SLAM assisted 3D tracking system for laparoscopic surgery},
author = {Jingwei Song and Ray Zhang and Wenwei Zhang and Hao Zhou and Maani Ghaffari},
journal= {arXiv preprint arXiv:2409.11688},
year = {2024}
}
备注
Demo: https://youtu.be/B1xZW8bj3cM