TokenMotion:基于 Token 解耦的基于 DiT 的人体相关视频生成运动控制
计算机视觉与模式识别
2025-04-14 v1 人工智能
摘要
人体相关运动控制在视频生成中仍是一个关键挑战,尤其是在需要同时控制摄像机运动和人体姿态的情况下,如著名的 Grammy Glambot 时刻。在最近的视频扩散模型方面取得了显著进展,但现有方法在运动表示有限和摄像机与人体运动控制集成不足方面存在困难。本文提出了 TokenMotion,是首个基于 DiT 的视频扩散框架,实现对摄像机运动、人体运动及其联合交互的精细控制。我们将摄像机轨迹和人体姿态表示为时空 token,以实现局部控制粒度。我们的方法引入了统一的建模框架,利用解耦-融合策略,借助人体感知动态掩码有效处理组合运动信号的时空变化特性。通过大量实验,我们证明 TokenMotion 在文本到视频和图像到视频范式中,在人体相关运动控制任务中 consistently 优于当前最先进的方法。我们的工作在可控视频生成领域取得了显著进展,尤其适用于创意制作应用。
引用
@article{arxiv.2504.08181,
title = {TokenMotion: Decoupled Motion Control via Token Disentanglement for Human-centric Video Generation},
author = {Ruineng Li and Daitao Xing and Huiming Sun and Yuanzhou Ha and Jinglin Shen and Chiuman Ho},
journal= {arXiv preprint arXiv:2504.08181},
year = {2025}
}