利用大语言模型实现运动示例控制的语音伴随手势生成
计算机视觉与模式识别
2025-07-29 v1
摘要
自动生成可控的语音伴随手势最近受到广泛关注。虽然现有系统通常通过预定义的分类标签或从运动示例中推导的隐式伪标签来实现手势控制,但这些方法往往会损失原始运动示例中所包含的丰富细节。我们提出了MECo框架,通过利用大语言模型(LLM)实现运动示例控制的语音伴随手势生成。该方法利用LLM的理解能力,通过微调同时解释语音音频和运动示例,从而合成保留示例特定特征同时保持语音一致性的手势。不同于常规的伪标签范式,我们将运动示例位置于提示结构中的显式查询上下文中,以引导手势生成。实验结果表明,在三个指标上实现了最先进的性能:Fréchet手势距离(FGD)、运动多样性和示例-手势相似性。此外,我们的框架支持对单个身体部位进行细粒度控制,并且可适应多种输入模态,包括运动剪辑、静态姿态、人类视频序列和文本描述。我们的代码、预训练模型和视频均可在 https://robinwitch.github.io/MECo-Page 提供。
引用
@article{arxiv.2507.20220,
title = {Motion-example-controlled Co-speech Gesture Generation Leveraging Large Language Models},
author = {Bohong Chen and Yumeng Li and Youyi Zheng and Yao-Xiang Ding and Kun Zhou},
journal= {arXiv preprint arXiv:2507.20220},
year = {2025}
}
备注
SIGGRAPH 2025; Project Page: https://robinwitch.github.io/MECo-Page