EMAGE:通过表达性掩码音频手势建模迈向统一的整体共语手势生成
计算机视觉与模式识别
2024-04-02 v5
摘要
我们提出了 EMAGE,这是一个从音频和掩码手势生成全身人体手势的框架,涵盖面部、局部身体、手部和全身运动。为此,我们首先引入了 BEAT2 (BEAT-SMPLX-FLAME),一个新的网格级整体共语数据集。BEAT2 结合了 MoShed SMPL-X 身体与 FLAME 头部参数,并进一步细化了头部、颈部和手指运动的建模,提供了一个社区标准化的高质量 3D 动作捕捉数据集。EMAGE 在训练期间利用掩码身体手势先验来提升推理性能。它涉及一个掩码音频手势 Transformer,促进音频到手势生成和掩码手势重建的联合训练,以有效编码音频和身体手势提示。来自掩码手势的编码身体提示随后被分别用于生成面部和身体运动。此外,EMAGE 自适应地合并来自音频节奏和内容的语音特征,并利用四个组合 VQ-VAEs 来增强结果的保真度和多样性。实验表明,EMAGE 生成的整体手势具有 state-of-the-art 性能,并且灵活接受预定义的时空手势输入,生成完整的、与音频同步的结果。我们的代码和数据集可在 https://pantomatrix.github.io/EMAGE/ 获取。
引用
@article{arxiv.2401.00374,
title = {EMAGE: Towards Unified Holistic Co-Speech Gesture Generation via Expressive Masked Audio Gesture Modeling},
author = {Haiyang Liu and Zihao Zhu and Giorgio Becherini and Yichen Peng and Mingyang Su and You Zhou and Xuefei Zhe and Naoya Iwamoto and Bo Zheng and Michael J. Black},
journal= {arXiv preprint arXiv:2401.00374},
year = {2024}
}
备注
Fix typos; Conflict of Interest Disclosure; CVPR Camera Ready; Project Page: https://pantomatrix.github.io/EMAGE/