中文

MoGAN:通过少步运动对抗后训练提升视频扩散模型的运动质量

计算机视觉与模式识别 2025-11-27 v1

摘要

视频扩散模型在帧级保真度方面表现优异,但在运动连贯性、动态和真实性方面仍存在挑战,常产生抖动、幽灵现象或不合理的动态。一个关键局限是,标准去噪均方误差目标对时间一致性没有直接监督,使得模型在保持低损失的同时仍可能生成差差的运动。我们提出 MoGAN,一种以运动为中心的后训练框架,用于提升运动真实性,无需奖励模型或人类偏好数据。在基于 3 步蒸馏视频扩散模型之上,我们训练一个基于 DiT 的光流判别器来区分真实与生成的运动,并结合分布匹配正则化以保持视觉保真度。在 Wan2.1-T2V-1.3B 上的实验表明,MoGAN 在各类基准测试中显著提升了运动质量。于 VBench,MoGAN 在 50 步教师模型上提升运动得分 +7.3%,在 3 步 DMD 模型上提升 +13.3%。于 VideoJAM-Bench,MoGAN 在教师模型上提升运动得分 +7.4%,在 DMD 上提升 +8.8%,同时保持与之相当甚至更好的审美和图像质量得分。人类实验进一步确认,MoGAN 在运动质量上受到偏好(52% 对照教师 38%;56% 对照 DMD 29%)。总体而言,MoGAN 在不牺牲视觉保真度或效率的前提下,显著提升了运动的真实性,为实现快速高质量视频生成提供了实用路径。项目网页为:https://xavihart.github.io/mogan。

关键词

引用

@article{arxiv.2511.21592,
  title  = {MoGAN: Improving Motion Quality in Video Diffusion via Few-Step Motion Adversarial Post-Training},
  author = {Haotian Xue and Qi Chen and Zhonghao Wang and Xun Huang and Eli Shechtman and Jinrong Xie and Yongxin Chen},
  journal= {arXiv preprint arXiv:2511.21592},
  year   = {2025}
}