在大规模开放挑战中评估手势生成:GENEA Challenge 2022
摘要
本文报道了第二届GENEA Challenge,旨在对数据驱动的语音同步自动手势生成进行基准测试。参赛团队使用相同的语音与动作数据集构建手势生成系统。所有这些系统生成的动作通过标准化可视化流程渲染为视频,并在多项大规模众包用户研究中评估。与比较不同研究论文不同,此处结果差异仅源于方法间差异,从而实现对系统的直接比较。数据集基于18小时包含手指的不同人物双人对话全身动作捕捉。十支队伍参与包含两个层级(全身与上半身手势)的挑战。对每个层级,我们均评估了手势动作的类人程度及其对特定语音信号的恰当性。我们的评估将类人程度与手势恰当性解耦,这在该领域一直是个难题。评估结果显示,某些合成手势条件被评为显著比3D人体动作捕捉更具类人感。据我们所知,此前从未被证明过。另一方面,所有合成动作被发现对语音的恰当性远不及原始动作捕捉记录。我们还发现,在此大规模评估中,常规客观指标与主观类人程度评分相关性不佳。唯一的例外是Fréchet手势距离(FGD),其Kendall's tau秩相关约为-0.5。基于挑战结果,我们提出了诸多关于系统构建与评估的建议。
引用
@article{arxiv.2303.08737,
title = {Evaluating gesture generation in a large-scale open challenge: The GENEA Challenge 2022},
author = {Taras Kucherenko and Pieter Wolfert and Youngwoo Yoon and Carla Viegas and Teodor Nikolov and Mihail Tsakov and Gustav Eje Henter},
journal= {arXiv preprint arXiv:2303.08737},
year = {2024}
}
备注
The first three authors made equal contributions and share joint first authorship. Accepted for publication in the ACM Transactions on Graphics (TOG).Please see https://youngwoo-yoon.github.io/GENEAchallenge2022/ for all challenge materials. arXiv admin note: text overlap with arXiv:2208.10441