中文

GUESS:用于文本驱动人体动作生成的渐进丰富合成

计算机视觉与模式识别 2024-01-09 v2

摘要

在本文中,我们提出了一种新颖的基于级联扩散的文本驱动人体动作合成生成框架,该框架利用了一种名为渐进丰富合成(简称 GUESS)的策略。该策略通过将详细骨架中语义相近的身体关节组合在一起,然后将每个关节组替换为单一的身体部位节点来设定生成目标。这种操作在多个粒度级别上将人体姿态递归地抽象为越来越粗糙的骨架。随着抽象级别的逐渐提高,人体动作变得越来越简洁和稳定,这极大地有利于跨模态动作合成任务。整个文本驱动的人体动作合成问题随后被划分为多个抽象级别,并通过具有级联潜扩散模型的多阶段生成框架来解决:初始生成器首先根据给定的文本描述生成最粗糙的人体动作猜测;然后,一系列连续的生成器根据文本描述和先前合成的结果逐渐丰富动作细节。值得注意的是,我们进一步将 GUESS 与所提出的动态多条件融合机制相结合,以在不同生成阶段动态平衡给定文本条件和合成的粗糙动作提示的协同效应。在大规模数据集上的大量实验验证了 GUESS 在准确性、真实性和多样性方面大幅优于现有的 SOTA 方法。代码可在 https://github.com/Xuehao-Gao/GUESS 获取。

关键词

引用

@article{arxiv.2401.02142,
  title  = {GUESS:GradUally Enriching SyntheSis for Text-Driven Human Motion Generation},
  author = {Xuehao Gao and Yang Yang and Zhenyu Xie and Shaoyi Du and Zhongqian Sun and Yang Wu},
  journal= {arXiv preprint arXiv:2401.02142},
  year   = {2024}
}

备注

Accepted by IEEE Transactions on Visualization and Computer Graphics (2024)