MotionCLIP:将人体运动生成暴露于 CLIP 空间
计算机视觉与模式识别
2022-03-16 v1 图形学
摘要
我们提出 MotionCLIP,一种三维人体运动自编码器,其潜嵌入具有解耦、良态且支持高度语义化文本描述的特点。MotionCLIP 通过将潜空间与对比语言-图像预训练(CLIP)模型的潜空间对齐而获得其独特能力。将人体运动流形对齐至 CLIP 空间,隐式地将 CLIP 极其丰富的语义知识注入该流形。特别地,它通过将语义相似的运动彼此靠近放置来帮助连续性,以及从 CLIP 空间结构继承的解耦性。MotionCLIP 包含一个基于 transformer 的运动自编码器,经训练以重建运动同时对齐至其文本标签在 CLIP 空间中的位置。我们进一步利用 CLIP 独有的视觉理解,通过以自监督方式将运动对齐至渲染帧来注入更强的信号。我们表明,尽管 CLIP 从未见过运动域,MotionCLIP 提供了前所未有的文本到运动能力,允许域外动作、解耦编辑和抽象语言指定。例如,文本提示“couch”被解码为坐下动作(由于语言相似性),而提示“Spiderman”产生类蛛网摆荡的解法,远超出训练中所见。此外,我们展示了所引入潜空间如何被用于运动插值、编辑与识别。
引用
@article{arxiv.2203.08063,
title = {MotionCLIP: Exposing Human Motion Generation to CLIP Space},
author = {Guy Tevet and Brian Gordon and Amir Hertz and Amit H. Bermano and Daniel Cohen-Or},
journal= {arXiv preprint arXiv:2203.08063},
year = {2022}
}