MotionLab:基于动作-条件-动作范式的统一人体动作生成与编辑
计算机视觉与模式识别
2025-07-23 v5
摘要
人体动作生成与编辑是计算机视觉的关键组成部分。然而,该领域的现有方法往往倾向于提供针对特定任务的孤立解决方案,这对于实际应用而言效率低下且不切实际。尽管已有一些工作致力于统一动作相关任务,但这些方法仅将不同模态作为条件来引导动作生成。因此,它们缺乏编辑能力和细粒度控制,且无法促进任务间的知识共享。为了解决这些局限性并提供一个能够同时处理人体动作生成与编辑的通用统一框架,我们引入了一种新范式:\textbf{Motion-Condition-Motion},该范式通过源动作、条件和目标动作三个概念实现了对多种任务的统一表述。基于此范式,我们提出了一个统一框架 \textbf{MotionLab},该框架结合整流流,在指定条件的引导下学习从源动作到目标动作的映射。在 MotionLab 中,我们引入了:1) MotionFlow Transformer,以在无需任务特定模块的情况下增强条件生成与编辑;2) 对齐旋转位置编码,以保证源动作与目标动作之间的时间同步;3) 任务指定指令调制;以及 4) 动作课程学习,用于有效的多任务学习和跨任务知识共享。值得注意的是,我们的 MotionLab 在多个人体动作基准测试上展现出了良好的泛化能力和推理效率。我们的代码及更多视频结果见:https://diouo.github.io/motionlab.github.io/。
引用
@article{arxiv.2502.02358,
title = {MotionLab: Unified Human Motion Generation and Editing via the Motion-Condition-Motion Paradigm},
author = {Ziyan Guo and Zeyu Hu and De Wen Soh and Na Zhao},
journal= {arXiv preprint arXiv:2502.02358},
year = {2025}
}
备注
Accepted by ICCV 2025