FrankenMotion:部件级人体动作生成与组合
计算机视觉与模式识别
2026-01-19 v1
摘要
基于文本提示的人体动作生成近年来取得了显著进展。然而,由于缺乏细粒度的部件级动作标注,现有方法主要依赖序列级或动作级描述,这限制了对身体各部位的可控性。在本工作中,我们利用大语言模型(LLMs)的推理能力,构建了一个具有原子化、时间感知的部件级文本标注的高质量动作数据集。与以往仅提供固定时间段同步部件描述或完全依赖全局序列标签的数据集不同,我们的数据集以精细的时间分辨率捕捉了异步且语义上截然不同的部件运动。基于该数据集,我们引入了一个基于扩散模型的部件感知动作生成框架,即 FrankenMotion,其中每个身体部位由其自身具有时间结构的文本提示引导。据我们所知,这是首个提供原子化、时间感知的部件级动作标注,并允许通过空间(身体部位)和时间(原子动作)控制进行动作生成的模型。实验表明,FrankenMotion 优于所有针对我们设定进行适配和重训练的基线模型,且我们的模型能够组合训练中未见过的动作。我们的代码和数据集将在发表后公开。
引用
@article{arxiv.2601.10909,
title = {FrankenMotion: Part-level Human Motion Generation and Composition},
author = {Chuqiao Li and Xianghui Xie and Yong Cao and Andreas Geiger and Gerard Pons-Moll},
journal= {arXiv preprint arXiv:2601.10909},
year = {2026}
}
备注
Project page: https://coral79.github.io/frankenmotion/