基于联合文本与音频表示的扩散式语音协同手势生成
音频与语音处理
2023-09-12 v1 人机交互
机器学习
声音
摘要
本文描述了为 GENEA(具身智能体非言语行为生成与评估)挑战赛 2023 开发的系统。我们的方案构建于已有的基于扩散的运动合成模型之上。我们提出对比语音与运动预训练(CSMP)模块,其学习语音与手势的联合嵌入,旨在习得这些模态间的语义耦合。CSMP 模块的输出用作基于扩散的手势合成模型中的条件信号,以实现语义感知的语音协同手势生成。我们的参赛系统在所提交系统中获得了最高拟人度与最高语音恰当性评分。这表明我们的系统是实现具身智能体中承载语义的人类般语音协同手势的有前景途径。
引用
@article{arxiv.2309.05455,
title = {Diffusion-Based Co-Speech Gesture Generation Using Joint Text and Audio Representation},
author = {Anna Deichler and Shivam Mehta and Simon Alexanderson and Jonas Beskow},
journal= {arXiv preprint arXiv:2309.05455},
year = {2023}
}