VarGes:基于 StyleCLIPS 提升协同语音 3D 手势生成的多样性
计算机视觉与模式识别
2025-02-19 v2
摘要
从音频生成富有表现力且多样的人体手势在人机交互、虚拟现实和动画等领域至关重要。尽管现有方法已取得显著性能,但由于数据集多样性受限以及从音频输入中获取的信息量有限,它们往往存在局限性。为了应对这些挑战,我们提出了 VarGes,一种新颖的多样性驱动框架,旨在通过整合视觉风格线索来增强协同语音手势生成,同时保持自然性。我们的方法首先采用多样性增强特征提取(VEFE)模块,将风格参考视频数据无缝融入 3D 人体姿态估计网络以提取 StyleCLIPS,从而用风格信息丰富输入。随后,我们采用多样性补偿风格编码器(VCSE),这是一种配备了加性注意力机制池化层的 Transformer 风格编码器,用于稳健地编码多样的 StyleCLIPS 表示并有效管理风格变化。最后,多样性驱动手势预测器(VDGP)模块通过交叉注意力将 MFCC 音频特征与 StyleCLIPS 编码融合,将此融合数据注入跨条件自回归模型,以根据音频输入和风格线索调制 3D 人体手势生成。我们方法的有效性在基准数据集上得到了验证,其在手势多样性和自然性方面均优于现有方法。代码和视频结果将在被接收后公开发布:https://github.com/mookerr/VarGES/ 。
引用
@article{arxiv.2502.10729,
title = {VarGes: Improving Variation in Co-Speech 3D Gesture Generation via StyleCLIPS},
author = {Ming Meng and Ke Mu and Yonggui Zhu and Zhe Zhu and Haoyu Sun and Heyang Yan and Zhaoxin Fan},
journal= {arXiv preprint arXiv:2502.10729},
year = {2025}
}