中文

MimicParts:基于部件感知风格注入的语音驱动3D运动生成

计算机视觉与模式识别 2025-10-16 v1 人工智能

摘要

从语音信号生成带风格的3D人体运动仍面临重大挑战,主要原因是语音信号、个人风格及其对应身体运动之间存在复杂且细粒度的关系。当前的风格编码方法要么过于简化风格多样性,要么忽略区域运动风格差异(例如上半身与下半身),限制了运动的真实性。此外,运动风格应动态适应语音节奏和情绪的变化,但现有方法往往忽视了这一点。为此,我们提出了MimicParts,一种基于部件感知风格注入和部件感知去噪网络以增强带风格运动生成的新型框架。它将身体划分为不同区域以编码局部运动风格,使模型能够捕捉细粒度的区域差异。此外,我们的部件感知注意力模块允许节奏和情绪线索精确指导每个身体区域,确保生成的运动与语音节奏和情绪状态的变化相吻合。实验结果表明,我们的方法在现有方法上表现优异,生成的3D人体运动序列具有自然性和表达性。

关键词

引用

@article{arxiv.2510.13208,
  title  = {MimicParts: Part-aware Style Injection for Speech-Driven 3D Motion Generation},
  author = {Lianlian Liu and YongKang He and Zhaojie Chu and Xiaofen Xing and Xiangmin Xu},
  journal= {arXiv preprint arXiv:2510.13208},
  year   = {2025}
}