TRiMM:用于数字人实时多模态交互的基于 Transformer 的丰富动作匹配
图形学
2025-06-03 v1 人机交互
摘要
大型语言模型(LLM)驱动的数字人引发了一系列关于协同语音手势生成系统的最新研究。然而,现有的方法在实时合成和长文本理解方面存在困难。本文介绍了基于 Transformer 的丰富动作匹配(TRiMM),一种用于实时 3D 手势生成的新型多模态框架。我们的方法包含三个模块:1) 跨模态注意力机制,用于实现语音和手势之间精确的时间对齐;2) 带有滑动窗口机制的长上下文自回归模型,用于有效的序列建模;3) 大规模手势匹配系统,构建原子动作库并实现实时检索。此外,我们在 Unreal Engine 中开发了一个轻量级流水线用于实验。我们的方法在消费级 GPU(Geforce RTX3060)上实现了 120 fps 的实时推理,并保持了每句 0.15 秒的延迟。在 ZEGGS 和 BEAT 数据集上的广泛的主客观评估表明,我们的模型优于当前 state-of-the-art 方法。TRiMM 提高了协同语音手势生成的速度,同时确保了手势质量,使 LLM 驱动的数字人能够实时响应语音并合成相应的手势。我们的代码可在 https://github.com/teroon/TRiMM-Transformer-Based-Rich-Motion-Matching 获取。
引用
@article{arxiv.2506.01077,
title = {TRiMM: Transformer-Based Rich Motion Matching for Real-Time multi-modal Interaction in Digital Humans},
author = {Yueqian Guo and Tianzhao Li and Xin Lyu and Jiehaolin Chen and Zhaohan Wang and Sirui Xiao and Yurun Chen and Yezi He and Helin Li and Fan Zhang},
journal= {arXiv preprint arXiv:2506.01077},
year = {2025}
}
备注
24 pages,12 figures