中文

MotionAgent:通过运动场代理实现细粒度可控视频生成

机器人学 2025-04-15 v3 人工智能

摘要

我们提出MotionAgent,使能够对文本引导的图像到视频生成实现细粒度运动控制。关键技术是运动场代理(motion field agent),将文本提示中的运动信息转换为显式运动场,提供灵活且精确的运动指导。具体而言,代理提取文本中描述的对象运动和相机运动,分别转换为对象轨迹和相机外参。分析的光流组成模块将这些运动表示在三维空间中集成,并投影到统一的光流上。光流适配器采用该光流控制基本图像到视频扩散模型,以生成细粒度受控视频。VBench上Video-Text Camera Motion指标的显著提升表明,我们的方法实现了对相机运动的精确控制。我们构建了VBench的一个子集用于评估文本中运动信息与生成视频之间的对齐程度,在运动生成精度方面超越了其他先进模型。

关键词

引用

@article{arxiv.2502.03206,
  title  = {A Unified and General Humanoid Whole-Body Controller for Versatile Locomotion},
  author = {Yufei Xue and Wentao Dong and Minghuan Liu and Weinan Zhang and Jiangmiao Pang},
  journal= {arXiv preprint arXiv:2502.03206},
  year   = {2025}
}

备注

Published at RSS 2025. The first two authors contribute equally. Project page: https://hugwbc.github.io/