中文

GENEA Challenge 2023:单人与双人场景下手势生成模型的大规模评测

人机交互 2023-08-25 v1 图形学 机器学习

摘要

本文报道了 GENEA Challenge 2023,在该挑战中,各参与团队使用相同的语音与动作数据集构建语音驱动的手势生成系统,随后进行了联合评测。今年的挑战提供了双人交互双方的数据,允许团队在给定智能体自身语音(文本与音频)以及对话者的语音和动作的情况下,生成智能体的全身动作。我们在多项大规模用户研究中,将 12 个提交系统与 2 个基线以及留出的动作捕捉数据一同进行了评测。这些研究聚焦于三个方面:1) 动作的类人程度;2) 在控制动作类人程度的前提下,动作对智能体自身语音的适宜性;3) 在控制动作类人程度和智能体自身语音的设置下,动作对交互中对话者行为的适宜性。我们发现各挑战提交系统在类人程度上差异很大,少数系统评分接近人类动作捕捉。适宜性似乎远未解决,大多数提交系统表现在一个略高于随机水平的小范围内,远落后于自然动作。对话者的影响更为微妙,提交系统最多仅勉强高于随机水平。有趣的是,一个双人系统在智能体语音上高度适宜,并不一定意味着对对话者高度适宜。额外材料可通过项目网站 https://svito-zar.github.io/GENEAchallenge2023/ 获取。

关键词

引用

@article{arxiv.2308.12646,
  title  = {The GENEA Challenge 2023: A large scale evaluation of gesture generation models in monadic and dyadic settings},
  author = {Taras Kucherenko and Rajmund Nagy and Youngwoo Yoon and Jieyeon Woo and Teodor Nikolov and Mihail Tsakov and Gustav Eje Henter},
  journal= {arXiv preprint arXiv:2308.12646},
  year   = {2023}
}

备注

The first three authors made equal contributions. Accepted for publication at the ACM International Conference on Multimodal Interaction (ICMI)