用于语音同步手势生成的层次化跨模态关联学习
计算机视觉与模式识别
2022-03-25 v1
摘要
生成与语音一致的身体与手势动作是虚拟形象创建中的长期问题。以往研究常以整体方式合成姿态运动,即所有关节的姿态同时生成。这种直接的流程难以生成细粒度的语音同步手势。一个观察是,语音中的层次化语义与人手势的层次化结构可自然描述为多种粒度并相互关联。为充分利用语音音频与人手势之间丰富的联系,我们提出一种名为层次化音频到手势(HA2G)的新框架用于语音同步手势生成。在 HA2G 中,层次化音频学习器提取跨语义粒度的音频表示。随后层次化姿态推断器以层次化方式逐步渲染完整人体姿态。为提升合成手势的质量,我们开发了基于音频-文本对齐的对比学习策略以获得更好的音频表示。大量实验与人评表明,所提方法渲染出逼真的语音同步手势,并以明显优势超越以往方法。项目页面:https://alvinliu0.github.io/projects/HA2G
引用
@article{arxiv.2203.13161,
title = {Learning Hierarchical Cross-Modal Association for Co-Speech Gesture Generation},
author = {Xian Liu and Qianyi Wu and Hang Zhou and Yinghao Xu and Rui Qian and Xinyi Lin and Xiaowei Zhou and Wayne Wu and Bo Dai and Bolei Zhou},
journal= {arXiv preprint arXiv:2203.13161},
year = {2022}
}
备注
Accepted by IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2022. Camera-Ready Version, 19 Pages