中文

MPE4G:面向协同语音手势生成的多模态预训练编码器

计算机视觉与模式识别 2023-05-26 v1 人工智能

摘要

当虚拟智能体与人类交互时,手势对于配合语音传达其意图至关重要。以往的协同语音手势生成多模态模型需要所有模态的编码特征来生成手势。若某些输入模态被移除或含有噪声,模型可能无法正确生成手势。为获取鲁棒且泛化的编码,我们提出了一种带有多模态预训练编码器的协同语音手势生成新框架。在所提方法中,基于多头注意力的编码器通过自监督学习训练以包含各模态信息。此外,我们采集由 3D 关节旋转组成的全身手势以改善可视化,并将手势应用于可扩展身体模型。通过一系列实验与人工评估,所提方法不仅在给定所有输入模态时能渲染逼真的协同语音手势,而且在输入模态缺失或含噪时亦可。

关键词

引用

@article{arxiv.2305.15740,
  title  = {MPE4G: Multimodal Pretrained Encoder for Co-Speech Gesture Generation},
  author = {Gwantae Kim and Seonghyeok Noh and Insung Ham and Hanseok Ko},
  journal= {arXiv preprint arXiv:2305.15740},
  year   = {2023}
}

备注

5 pages, 3 figures