大型身体语言模型
人工智能
2024-10-23 v1 计算与语言
计算机视觉与模式识别
机器学习
摘要
随着虚拟代理在人机交互中的日益普及,实时生成逼真且情境恰当的手势仍然是一个重要挑战。虽然神经渲染技术在静态脚本方面取得了 substantial进展,但其在人机交互中的适用性仍有限。为此,我们引入大型身体语言模型 (LBLMs),并提出 LBLM-AVA,一种新颖的 LBLM 架构,将 Transformer-XL 大型语言模型与并行化扩散模型结合,用于从多模态输入 (文本、音频和视频) 生成类人手势。LBLM-AVA 包含Several key 组件增强其手势生成能力,如多模态到姿态嵌入、通过重新定义注意力机制实现的增强序列到序列映射、用于手势序列连贯性的时序平滑模块以及用于增强真实感的注意力基 refinement 模块。该模型在我们大规模专有开源数据集 Allo-AVA 上进行训练。LBLM-AVA 在生成逼真且情境恰当的手势方面实现了状态-of-the-art 性能,F"echet Gesture Distance (FGD) 降低 30%,Fr"echet Inception Distance 相较于现有方法提升 25%。
引用
@article{arxiv.2410.16533,
title = {Large Body Language Models},
author = {Saif Punjwani and Larry Heck},
journal= {arXiv preprint arXiv:2410.16533},
year = {2024}
}