中文

FlashMotion:基于轨迹引导的少步可控视频生成

计算机视觉与模式识别 2026-03-13 v1 人工智能 机器学习 多媒体

摘要

近期进展在轨迹可控视频生成取得了显著进展。以适配器为主的先前方法主要用于在预定义轨迹上实现精确运动控制。然而,这些方法都依赖于多步去噪过程,导致显著的时间冗余和计算开销。虽然现有的视频蒸馏方法成功地将多步生成器蒸馏到少步骤,但直接将这些方法应用于轨迹可控视频生成会导致视频质量和轨迹精度的明显下降。为填补这一差距,我们引入了 FlashMotion,一个为少步骤轨迹可控视频生成设计的新训练框架。我们首先在多步骤视频生成器上训练轨迹适配器,以实现精确的轨迹控制。然后,我们将生成器蒸馏到少步骤版本以加速视频生成。最后,我们采用结合扩散和对抗目标的混合策略微调适配器,将其与少步骤生成器对齐,以产生高质量且轨迹精确的视频。为评估,我们引入了 FlashBench,这是一个衡量长序列轨迹可控视频生成的基准,评估在不同前景物体数量下视频质量和轨迹精度。实验表明,FlashMotion 在两种适配器架构上,超越了现有的视频蒸馏方法和以前的多步骤模型在视觉质量和轨迹一致性方面的表现。

关键词

引用

@article{arxiv.2603.12146,
  title  = {FlashMotion: Few-Step Controllable Video Generation with Trajectory Guidance},
  author = {Quanhao Li and Zhen Xing and Rui Wang and Haidong Cao and Qi Dai and Daoguo Dong and Zuxuan Wu},
  journal= {arXiv preprint arXiv:2603.12146},
  year   = {2026}
}

备注

Accepted by CVPR2026