中文

基于自适应测试时蒸馏的无训练运动自定义: distilled video generators

计算机视觉与模式识别 2025-06-25 v1

摘要

蒸馏视频生成模型提供了快速高效的合成能力,但在无训练设置下受参考视频引导时难以实现运动自定义,尤其是针对蒸馏模型中加速的生成过程和较大的去噪步骤。现有的无训练方法原本为标准扩散模型设计,无法泛化。为此,我们提出了MotionEcho——一种新颖的无训练测试时蒸馏框架,通过利用扩散教师强制实现运动自定义。该方法使用高质量、慢速教师模型通过端点预测和插值指导快速学生模型的推理。为保持效率,我们根据引导需求动态分配跨时间步的计算资源。广泛的实验在各种蒸馏视频生成模型和基准数据集上表明,我们的方法在保持高效性的同时显著提升了运动保真度和生成质量。项目页面:https://euminds.github.io/motionecho/

关键词

引用

@article{arxiv.2506.19348,
  title  = {Training-Free Motion Customization for Distilled Video Generators with Adaptive Test-Time Distillation},
  author = {Jintao Rong and Xin Xie and Xinyi Yu and Linlin Ou and Xinyu Zhang and Chunhua Shen and Dong Gong},
  journal= {arXiv preprint arXiv:2506.19348},
  year   = {2025}
}