HumanTOMATO:文本对齐的全身运动生成
计算机视觉与模式识别
2023-10-20 v1
摘要
本工作面向一项新颖的文本驱动全身运动生成任务,其以给定文本描述为输入,旨在同时生成高质量、多样且连贯的面部表情、手势与身体运动。先前文本驱动运动生成工作主要有两方面的局限:忽视细粒度手与脸控制在生动全身运动生成中的关键作用,且缺乏文本与运动间的良好对齐。为应对此类局限,我们提出一个文本对齐的全身运动生成框架,命名为 HumanTOMATO,据我们所知这是该研究领域朝适用整体运动生成的首次尝试。为攻克这一挑战性任务,我们的方案包含两项关键设计:(1)一个整体分层 VQ-VAE(即 HVQ)与一种分层 GPT,借助两个结构化码本实现细粒度身体与手部运动重建及生成;以及(2)一个预训练的文本-运动对齐模型,以显式帮助生成运动对齐输入文本描述。综合实验验证我们的模型在生成运动质量及其与文本对齐上均具显著优势。
引用
@article{arxiv.2310.12978,
title = {HumanTOMATO: Text-aligned Whole-body Motion Generation},
author = {Shunlin Lu and Ling-Hao Chen and Ailing Zeng and Jing Lin and Ruimao Zhang and Lei Zhang and Heung-Yeung Shum},
journal= {arXiv preprint arXiv:2310.12978},
year = {2023}
}
备注
31 pages, 15 figures, 16 tables. Project page: https://lhchen.top/HumanTOMATO