中文

LLM Gesticulator: Leveraging 大型语言模型实现可扩展且可控的共语手势合成

图形学 2024-10-23 v2 人工智能 计算与语言 机器学习 声音 音频与语音处理

摘要

本工作提出了 LLM Gesticulator,一种基于大型语言模型(LLM)的音频驱动共语手势生成框架,该框架能够合成与输入音频节奏同步且具有自然运动和可编辑性的全身动画。与之前的工作相比,我们的方法在可扩展性方面表现出显著优势。随着背bone 大型语言模型规模的增加,本框架在评估指标上呈现比例性改进(即规模定律)。本方法还表现出强大的可控性,用户可通过文本提示控制生成手势的内容和风格。据我们了解,LLM Gesticulator 是首个将 LLM 应用于共语手势生成任务的工作。通过现有客观指标和用户研究评估,我们的框架在性能上优于先前工作。

关键词

引用

@article{arxiv.2410.10851,
  title  = {LLM Gesticulator: Leveraging Large Language Models for Scalable and Controllable Co-Speech Gesture Synthesis},
  author = {Haozhou Pang and Tianwei Ding and Lanshan He and Ming Tao and Lu Zhang and Qi Gan},
  journal= {arXiv preprint arXiv:2410.10851},
  year   = {2024}
}