DiffuseStyleGesture+ 参加 GENEA Challenge 2023 的方案
人机交互
2023-08-29 v1 人工智能
多媒体
摘要
在本文中,我们介绍了 DiffuseStyleGesture+,即我们针对 2023 年具身智能体非言语行为生成与评估(GENEA)挑战赛的解决方案,该挑战赛旨在促进用于生成对话手势的逼真自动化系统的开发。参与者会获得一个预处理数据集,其系统通过众包评分进行评估。我们提出的模型 DiffuseStyleGesture+ 利用扩散模型自动生成手势。它融合了多种模态,包括音频、文本、说话人 ID 和种子手势。这些不同的模态被映射到隐藏空间,并由一个改进的扩散模型处理,以针对给定语音输入生成相应手势。评估后,DiffuseStyleGesture+ 表现出与该挑战赛中顶级模型相当的性能,在人类相似度、对对话者的恰当性方面与这些模型无显著差异,并在对智能体语音的恰当性上取得与最佳模型相竞争的性能。这表明我们的模型在生成逼真且恰当的手势方面具有竞争力和有效性。代码、预训练模型和演示可在 https://github.com/YoungSeng/DiffuseStyleGesture/tree/DiffuseStyleGesturePlus/BEAT-TWH-main 获取。
引用
@article{arxiv.2308.13879,
title = {The DiffuseStyleGesture+ entry to the GENEA Challenge 2023},
author = {Sicheng Yang and Haiwei Xue and Zhensong Zhang and Minglei Li and Zhiyong Wu and Xiaofei Wu and Songcen Xu and Zonghong Dai},
journal= {arXiv preprint arXiv:2308.13879},
year = {2023}
}
备注
7 pages, 8 figures, ICMI 2023