中文

Ges-QA:用于音频到 3D 手势生成的多维质量评估数据集

多媒体 2026-03-27 v2

摘要

音频到 3D 手势 (A2G) 任务在虚拟现实和计算机图形等领域具有巨大的应用潜力。然而,当前的评估指标,如 Fr\'echet Gesture Distance 或 Beat Constancy,无法反映生成 3D 手势的人类偏好。为此,探索人类偏好并为 AI 生成的 3D 人体手势 develop objective 质量评估指标日益重要。本文我们引入 Ges-QA 数据集,包含 1,400 个样本,具有手势质量和音频-手势一致性的多维评分。此外,我们收集二元分类标签,用于确定生成的手势是否匹配音频的情绪。凭借我们的 Ges-QA 数据集,我们提出一种基于多模态转换器的神经网络,包含视频、音频和 3D 骨架三个分支,可在多个维度上对 A2G 内容进行评分。与实验比较和消融研究的结果表明,Ges-QAer 在我们的数据集上实现了最好的性能。

关键词

引用

@article{arxiv.2508.12020,
  title  = {Ges-QA: A Multidimensional Quality Assessment Dataset for Audio-to-3D Gesture Generation},
  author = {Zhilin Gao and Yunhao Li and Sijing Wu and Yuqin Cao and Huiyu Duan and Guangtao Zhai},
  journal= {arXiv preprint arXiv:2508.12020},
  year   = {2026}
}

备注

update the e-mail address