中文

2D还是非2D:手势表示的维度如何影响3D协同语音手势生成?

计算机视觉与模式识别 2024-09-30 v2 计算与语言 机器学习 声音 音频与语音处理

摘要

协同语音手势对交流至关重要。近期深度学习技术的出现促进了为具身对话代理创建逼真、同步的协同语音手势。“野外”数据集通过人体姿态检测技术从YouTube等平台聚合视频内容,通过提供与语音对齐的2D骨骼序列提供了一种可行的解决方案。提升模型的同步发展使得将这些2D序列转换为3D手势数据库成为可能。然而,重要的是,从2D提取姿态估计得到的3D姿态本质上是真实值的近似,而真实值仍处于2D域中。这一区别引发了手势表示维度对生成动作质量影响的问题——据我们所知,这一主题在很大程度上仍未被探索。我们的研究检验了使用2D或3D关节坐标作为训练数据对语音到手势深度生成模型性能的影响。我们采用提升模型将生成的2D姿态序列转换为3D,并评估直接在3D中创建的手势与最初在2D中生成随后转换为3D的手势相比表现如何。我们使用手势生成领域广泛使用的指标进行客观评估,并通过用户研究对不同方法进行定性评估。

关键词

引用

@article{arxiv.2409.10357,
  title  = {2D or not 2D: How Does the Dimensionality of Gesture Representation Affect 3D Co-Speech Gesture Generation?},
  author = {Téo Guichoux and Laure Soulier and Nicolas Obin and Catherine Pelachaud},
  journal= {arXiv preprint arXiv:2409.10357},
  year   = {2024}
}

备注

arXiv admin note: substantial text overlap with arXiv:2406.15111