中文

用于语义感知与语音驱动上面部生成的 Transformer 网络

音频与语音处理 2022-05-24 v2

摘要

我们提出一种语义感知的语音驱动模型,为具身对话代理(ECA)生成富有表现力且自然的上面部与头部运动。本工作中,我们旨在生成与语音同步的自然且连续的头部运动及上面部手势。我们提出的模型基于多模态输入特征生成这些手势:第一模态为文本,第二模态为语音韵律。我们的模型利用 Transformer 与卷积将对应一条话语的多模态特征映射为连续的眉毛与头部手势。我们进行了主观与客观评估以验证我们的方法,并与当前最优方法进行比较。

关键词

引用

@article{arxiv.2110.04527,
  title  = {Transformer Network for Semantically-Aware and Speech-Driven Upper-Face Generation},
  author = {Mireille Fares and Catherine Pelachaud and Nicolas Obin},
  journal= {arXiv preprint arXiv:2110.04527},
  year   = {2022}
}