PersonaGesture:单参考语音驱动手势个性化生成用于未见说话者
计算机视觉与模式识别
2026-05-08 v1
摘要
我们提出了PersonaGesture,一个基于扩散模型的管线,用于针对未见说话者进行单参考语音驱动手势个性化。给定目标语音和来自新说话者的一个动作片段,模型必须生成遵循新话语内容的手势,同时保留说话者特定的姿态选择,且无需按说话者进行优化。此设置对于虚拟形象和智能体很有用,但具有挑战性,因为参考动作混合了稳定的说话者习惯与话语特定轨迹。PersonaGesture包含两个关键组件:自适应风格注入(ASI)和隐式分布校正(IDR),用于分离时间上的身份证据与残差统计校正。首先,风格感知器将变长参考编码为紧凑的说话者记忆标记。ASI通过零初始化的残差交叉注意力将这些标记注入去噪过程,使风险证据能影响运动生成,而不取代预训练的语音到运动先验。基于此,IDR在潜在空间中应用长度感知的对角仿射变换,以校正来自同一参考的残差通道时刻。我们在BEAT2和ZeroEGGS上进行评估,包括量化指标、参考身份控制、相同音频诊断、定性比较和人类偏好测试。实验表明,在分离去噪时刻的说话者记忆与保守的后生成moment校正方面,PersonaGesture对未见说话者的个性化优于折叠风格代码、全参考注意力和单片优化。项目:https://xiangyue-zhang.github.io/PersonaGesture。
引用
@article{arxiv.2605.06064,
title = {PersonaGesture: Single-Reference Co-Speech Gesture Personalization for Unseen Speakers},
author = {Xiangyue Zhang and Yiyi Cai and Kunhang Li and Kaixing Yang and You Zhou and Zhengqing Li and Xuangeng Chu and Jiaxu Zhang and Haiyang Liu},
journal= {arXiv preprint arXiv:2605.06064},
year = {2026}
}