中文

ExGes:用于音频驱动手势合成的富有表现力的人体动作检索与调制

计算机视觉与模式识别 2026-04-03 v2 人工智能

摘要

音频驱动的人体手势合成是一项关键任务,在虚拟化身、人机交互和创意内容生成中具有广泛应用。尽管取得了显著进展,但现有方法生成的手势通常较为粗糙、缺乏表现力,且未能与音频语义完全对齐。为了应对这些挑战,我们提出了 ExGes,一种具有三个关键设计的新型检索增强扩散框架:(1) 动作库构建,利用训练数据集构建手势库;(2) 动作检索模块,采用对比学习和动量蒸馏进行细粒度参考姿态检索;(3) 精度控制模块,集成部分掩码和随机掩码以实现灵活且细粒度的控制。在 BEAT2 上的实验评估表明,与 EMAGE 相比,ExGes 将 Fréchet Gesture Distance 降低了 6.2%,并将动作多样性提高了 5.3%,用户研究表明 71.3% 的用户偏好其自然性和语义相关性。代码将在论文被接受后发布。

关键词

引用

@article{arxiv.2503.06499,
  title  = {ExGes: Expressive Human Motion Retrieval and Modulation for Audio-Driven Gesture Synthesis},
  author = {Xukun Zhou and Fengxin Li and Ming Chen and Yan Zhou and Pengfei Wan and Di Zhang and Yeying Jin and Zhaoxin Fan and Hongyan Liu and Jun He},
  journal= {arXiv preprint arXiv:2503.06499},
  year   = {2026}
}