中文

基于原子动作的语言引导人体运动合成

计算机视觉与模式识别 2023-08-21 v1

摘要

语言引导的人体运动合成由于人类行为固有的复杂性与多样性一直是一项具有挑战性的任务。以往方法在泛化到新动作方面存在局限,常导致不真实或不连贯的运动序列。本文中,我们提出 ATOM(ATomic mOtion Modeling,原子动作建模)来缓解该问题,通过将动作分解为原子动作,并采用课程学习策略来学习原子动作组合。首先,我们在学习过程中将复杂人体运动解耦为一组原子动作,随后利用所学原子动作组装新动作,从而对新动作具有更好的适应性。此外,我们引入一种课程学习训练策略,利用掩码运动建模并逐步增大掩码比例,从而促进原子动作组装。该方法缓解了以往方法普遍面临的过拟合问题,同时迫使模型学习更好的运动表征。我们通过大量实验(包括文本到运动和动作到运动合成任务)证明了 ATOM 的有效性。我们进一步展示了其在合成合理且连贯的文本引导人体运动序列方面的优越性。

关键词

引用

@article{arxiv.2308.09611,
  title  = {Language-guided Human Motion Synthesis with Atomic Actions},
  author = {Yuanhao Zhai and Mingzhen Huang and Tianyu Luan and Lu Dong and Ifeoma Nwogu and Siwei Lyu and David Doermann and Junsong Yuan},
  journal= {arXiv preprint arXiv:2308.09611},
  year   = {2023}
}

备注

Accepted to ACM MM 2023, code: https://github.com/yhZhai/ATOM