MotionHiFlow:基于层次流匹配的文本到运动生成
计算机视觉与模式识别
2026-04-28 v1
摘要
文本到运动生成旨在生成与输入文本紧密对齐、且物理上合理且细节丰富的 3D 人体运动。尽管近期方法能够产生复杂且自然的运动,但通常仅在单一时间尺度上运行,限制了语义对齐和时间连贯性。鼓励人类认知系统中复杂运动是分层次地而非在单一时间尺度上被概念化的事实,我们提出了\textit{MotionHiFlow},一种基于层次流匹配的框架,通过从低到高时间尺度构建流路径来逐层生成运动。较低尺度的流捕获高层语义和粗糙运动结构,而较高尺度的流则细化时间细节。为链接跨尺度的流,我们引入一种新颖的跨尺度转换过程,确保连续性并保持噪声一致性。此外,通过集成文本-运动扩散转换器和拓扑感知运动 VAE,MotionHiFlow 通过联合感知位置编码和骨骼拓扑显式建模关节之间的结构依赖关系,实现精确的语义对齐以及细粒度运动细节。在 HumanML3D 和 KIT-ML 基准上的大量实验表明,MotionHiFlow 实现了最先进的性能,消融研究确认了层次设计和关键组件的有效性。代码已公开于 https://github.com/ai-lh/MotionHiFlow。
引用
@article{arxiv.2604.23264,
title = {MotionHiFlow: Text-to-motion via hierarchical flow matching},
author = {Heng Li and Xiaotong Lin and Ling-An Zeng and Yulei Kang and Shuai Li and Jian-Fang Hu},
journal= {arXiv preprint arXiv:2604.23264},
year = {2026}
}
备注
accepted to CVPR 2026