LLAniMAtion: LLAMA驱动的手势动画
人机交互
2024-05-15 v1 人工智能
计算机视觉与模式识别
图形学
机器学习
摘要
语音伴随手势是对话中重要的模态,提供上下文和社交线索。在角色动画中,恰当且同步的手势有助于增强真实感,并使交互式代理更具吸引力。历史上,自动生成手势的方法主要是基于音频的,利用编码在音频信号中所包含的语音韵律和语音相关内容。在本文中,我们实验性地使用从文本中提取的LLAMA2特征进行手势生成。我们对比了音频特征,探索了两种模态的组合,进行客观测试和用户研究。令人惊讶的是,我们的结果显示,LLAMA2特征本身的表现显著优于音频特征,而将两种模态组合在一起与仅使用LLAMA2特征的效果并无显著差异。我们演示了LLAMA2基于的模型可以在没有音频输入的情况下生成both beat和semantic手势,表明LLM可以提供丰富的编码,适用于手势生成。
引用
@article{arxiv.2405.08042,
title = {LLAniMAtion: LLAMA Driven Gesture Animation},
author = {Jonathan Windle and Iain Matthews and Sarah Taylor},
journal= {arXiv preprint arXiv:2405.08042},
year = {2024}
}