中文

通过姿态和视频条件化编辑提升文本到运动模型中的运动变化

机器学习 2024-10-14 v1

摘要

从文本描述生成人体姿态序列的文本到运动模型正在受到广泛关注。然而,由于数据稀缺,这些模型能够产生的运动范围仍然有限。例如,当前文本到运动模型无法生成以脚跟踢球的动作,因为训练数据中仅包含武术 kick。我们提出了一种新方法,使用短视频片段或图像作为条件来修改现有的基本运动。在这种方法中,模型对 kick 的理解作为先验,视频或脚踢球的图像作为后验,实现所需运动的生成。通过将这些额外模态作为条件,我们的方法可以创建训练集中不存在的运动,克服了文本-运动数据集的局限性。26 名参与者的用户研究表明,我们的方法能够以与文本-运动数据集中常见运动(如 HumanML3D 中的步行、跑步、深蹲和踢腿)相当的逼真度,生成看似不存在的运动。

关键词

引用

@article{arxiv.2410.08931,
  title  = {Enhancing Motion Variation in Text-to-Motion Models via Pose and Video Conditioned Editing},
  author = {Clayton Leite and Yu Xiao},
  journal= {arXiv preprint arXiv:2410.08931},
  year   = {2024}
}