AQ-GT:一种用于语音协同手势合成的时序对齐与量化GRU-Transformer
人机交互
2023-05-09 v2 图形学
机器学习
声音
音频与语音处理
摘要
生成逼真且语境相关的语音协同手势,在构建多模态人工智能体这一日益重要的任务中颇具挑战。先前的方法侧重于学习语音协同手势表征与所产生动作之间的直接对应关系,这在人类评估中产生了看似自然但往往缺乏说服力的手势。我们提出了一种使用带量化流程的生成对抗网络对部分手势序列进行预训练的方法。所得的码本向量在我们的框架中同时作为输入和输出,构成手势生成与重建的基础。通过学习潜空间表征的映射而非直接将其映射到向量表征,该框架促进了高度逼真且富有表现力的手势的生成,这些手势紧密复现人类运动与行为,同时避免了生成过程中的伪影。我们通过将我们的方法与已有的语音协同手势生成方法以及现有人类行为数据集进行比较来评估我们的方法。我们还进行了消融实验以评估我们的发现。结果表明,我们的方法以明显优势超越当前最先进水平(SOTA),且在部分情况下与人类手势无法区分。我们公开了我们的数据流水线与生成框架。
引用
@article{arxiv.2305.01241,
title = {AQ-GT: a Temporally Aligned and Quantized GRU-Transformer for Co-Speech Gesture Synthesis},
author = {Hendric Voß and Stefan Kopp},
journal= {arXiv preprint arXiv:2305.01241},
year = {2023}
}