中文

LLAniMAtion: LLAMA驱动的手势动画

人机交互 2024-05-15 v1 人工智能 计算机视觉与模式识别 图形学 机器学习

摘要

语音伴随手势是对话中重要的模态,提供上下文和社交线索。在角色动画中,恰当且同步的手势有助于增强真实感,并使交互式代理更具吸引力。历史上,自动生成手势的方法主要是基于音频的,利用编码在音频信号中所包含的语音韵律和语音相关内容。在本文中,我们实验性地使用从文本中提取的LLAMA2特征进行手势生成。我们对比了音频特征,探索了两种模态的组合,进行客观测试和用户研究。令人惊讶的是,我们的结果显示,LLAMA2特征本身的表现显著优于音频特征,而将两种模态组合在一起与仅使用LLAMA2特征的效果并无显著差异。我们演示了LLAMA2基于的模型可以在没有音频输入的情况下生成both beat和semantic手势,表明LLM可以提供丰富的编码,适用于手势生成。

关键词

引用

@article{arxiv.2405.08042,
  title  = {LLAniMAtion: LLAMA Driven Gesture Animation},
  author = {Jonathan Windle and Iain Matthews and Sarah Taylor},
  journal= {arXiv preprint arXiv:2405.08042},
  year   = {2024}
}