中文

GesGPT:基于ChatGPT文本解析的语音手势合成

计算与语言 2024-05-29 v3 计算机视觉与模式识别 人机交互

摘要

手势合成作为一个关键研究领域已获得显著关注,旨在生成与语音或文本输入相对应的、语境恰当且自然的肢体手势。尽管基于深度学习的方法取得了显著进展,它们往往忽视文本中丰富的语义信息,导致生成的手势表现力与意义不足。在本文中,我们提出GesGPT,一种利用大语言模型(如ChatGPT)语义分析能力的全新手势生成方法。通过发挥LLM在文本分析上的优势,我们采用一种可控方法,借助文本解析脚本生成并整合专业手势与基础手势,从而产生多样且富有意义的手势。首先,我们的方法涉及开发提示原则,将手势生成转化为使用ChatGPT的意图分类问题。我们还对强调词与语义词进行进一步分析以辅助手势生成。随后,我们构建带有多重语义标注的专用手势词典,将手势合成解耦为专业手势与基础手势。最后,我们将专业手势与基础手势相融合。实验结果表明,GesGPT能有效生成语境恰当且富有表现力的手势。

关键词

引用

@article{arxiv.2303.13013,
  title  = {GesGPT: Speech Gesture Synthesis With Text Parsing from ChatGPT},
  author = {Nan Gao and Zeyu Zhao and Zhi Zeng and Shuwu Zhang and Dongdong Weng and Yihua Bao},
  journal= {arXiv preprint arXiv:2303.13013},
  year   = {2024}
}