MIBURI:面向富有表现力的交互式手势合成
计算机视觉与模式识别
2026-03-30 v2 图形学
人机交互
摘要
具身对话代理人(ECA)旨在通过语音、手势和面部表情来模拟面对面的人类交互。当前基于大语言模型(LLM)的对话代理缺乏具身性以及实现自然交互所必需的富有表现力的手势。现有的ECA解决方案常产生僵硬、低多样性的动作,难以适用于人类化的交互。或者,基于生成方法的共语气手势合成产生自然的身体动作,但依赖未来的语境且运行时间较长。为弥合这一差距,我们提出MIBURI——首个在线、因果的框架,用于生成与实时语音对话同步的富有表现力的全身手势和面部表情。我们采用部件感知的手势编解码器,将层次化运动细节编码为多级离散标记。这些标记随后通过二维因果框架自动生成,基于LLM生成的语音-文本嵌入,实时建模时序动力学和部件级运动层次。进一步,我们引入辅助目标,以鼓励手势的表现力和多样性,同时防止收敛到静态姿态。比较评估表明,我们的因果和实时方法在最新基准方法面前产生自然且情境一致的手势。我们鼓励读者访问 https://vcai.mpi-inf.mpg.de/projects/MIBURI/ 上的演示视频。
引用
@article{arxiv.2603.03282,
title = {MIBURI: Towards Expressive Interactive Gesture Synthesis},
author = {M. Hamza Mughal and Rishabh Dabral and Vera Demberg and Christian Theobalt},
journal= {arXiv preprint arXiv:2603.03282},
year = {2026}
}
备注
CVPR 2026 (Main). Project page: https://vcai.mpi-inf.mpg.de/projects/MIBURI/