中文

QPoser:用于可控姿态生成的量化显式姿态先验建模

计算机视觉与模式识别 2023-12-05 v1

摘要

显式姿态先验模型将人体姿态压缩为潜在表示,以用于姿态相关的下游任务。一个理想的显式姿态先验模型应满足三项期望能力:1)正确性,即确保生成物理上合理的姿态;2)表现力,即确保在生成中保留细节;3)可控性,即从参考姿态和显式指令进行生成应便捷。现有的显式姿态先验模型无法同时满足这三项特性,尤其是可控性。为打破这一局面,我们提出了 QPoser,一种高度可控的显式姿态先验模型,可保证正确性与表现力。在 QPoser 中,我们提出了多头矢量量化自编码器(MS-VQVAE),以获得具有表现力且分布式的姿态表示。此外,我们利用全局—局部特征整合机制(GLIF-AE)来解耦潜在表示,并将全身信息整合到局部关节特征中。实验结果表明,QPoser 在表示具有表现力且正确的姿态方面显著优于当前最先进的方法,同时易于用于基于参考姿态和提示指令的细节条件生成。

关键词

引用

@article{arxiv.2312.01104,
  title  = {QPoser: Quantized Explicit Pose Prior Modeling for Controllable Pose Generation},
  author = {Yumeng Li and Yaoxiang Ding and Zhong Ren and Kun Zhou},
  journal= {arXiv preprint arXiv:2312.01104},
  year   = {2023}
}