2D还是非2D:手势表示的维度如何影响3D协同语音手势生成?
计算机视觉与模式识别
2024-09-30 v2 计算与语言
机器学习
声音
音频与语音处理
摘要
协同语音手势对交流至关重要。近期深度学习技术的出现促进了为具身对话代理创建逼真、同步的协同语音手势。“野外”数据集通过人体姿态检测技术从YouTube等平台聚合视频内容,通过提供与语音对齐的2D骨骼序列提供了一种可行的解决方案。提升模型的同步发展使得将这些2D序列转换为3D手势数据库成为可能。然而,重要的是,从2D提取姿态估计得到的3D姿态本质上是真实值的近似,而真实值仍处于2D域中。这一区别引发了手势表示维度对生成动作质量影响的问题——据我们所知,这一主题在很大程度上仍未被探索。我们的研究检验了使用2D或3D关节坐标作为训练数据对语音到手势深度生成模型性能的影响。我们采用提升模型将生成的2D姿态序列转换为3D,并评估直接在3D中创建的手势与最初在2D中生成随后转换为3D的手势相比表现如何。我们使用手势生成领域广泛使用的指标进行客观评估,并通过用户研究对不同方法进行定性评估。
引用
@article{arxiv.2409.10357,
title = {2D or not 2D: How Does the Dimensionality of Gesture Representation Affect 3D Co-Speech Gesture Generation?},
author = {Téo Guichoux and Laure Soulier and Nicolas Obin and Catherine Pelachaud},
journal= {arXiv preprint arXiv:2409.10357},
year = {2024}
}
备注
arXiv admin note: substantial text overlap with arXiv:2406.15111