TEACH:面向三维人体的时序动作组合
计算机视觉与模式识别
2022-09-13 v2
摘要
给定一系列自然语言描述,我们的任务是生成在语义上对应于文本并遵循指令时间顺序的三维人体运动。具体而言,我们的目标是实现一系列动作的合成,我们称之为时序动作组合。当前文本条件运动合成的最优方法仅接受单个动作或单个句子作为输入。这部分是由于缺乏包含动作序列的合适训练数据,但也由于其非自回归模型公式的计算复杂性,该公式难以良好地扩展到长序列。在本工作中,我们同时解决这两个问题。首先,我们利用近期的 BABEL 运动-文本数据集,其具有广泛的标注动作,其中许多以带过渡的序列形式出现。接下来,我们设计了一种基于 Transformer 的方法,该方法在动作内部以非自回归方式运行,但在动作序列内部以自回归方式运行。与多个基线相比,这种分层公式在我们的实验中证明是有效的。我们称为 TEACH(即“TEmporal Action Compositions for Human motions”)的方法,从语言描述中生成了针对广泛动作和时序组合的真实人体运动。为鼓励针对这一新任务的研究,我们在我们的 上公开了代码以供研究使用。
引用
@article{arxiv.2209.04066,
title = {TEACH: Temporal Action Composition for 3D Humans},
author = {Nikos Athanasiou and Mathis Petrovich and Michael J. Black and Gül Varol},
journal= {arXiv preprint arXiv:2209.04066},
year = {2022}
}
备注
3DV 2022 Camera Ready, Affiliations corrected