中文

自精炼视频采样

计算机视觉与模式识别 2026-05-21 v2 机器学习

摘要

现代视频生成器仍然难以处理复杂的物理动力学,常常无法达到物理真实感。现有方法通过使用外部验证器或对增强数据进行额外训练来解决此问题,这在计算上代价高昂,且在捕捉细粒度运动方面仍然有限。在本工作中,我们提出了自精炼视频采样,这是一种简单的方法,利用在大规模数据集上预训练的视频生成器作为其自身的精炼器。通过将生成器解释为去噪自编码器,我们能够在推理时实现迭代内循环精炼,而无需任何外部验证器或额外训练。我们进一步引入了一种不确定性感知的精炼策略,该策略基于自洽性选择性地精炼区域,从而防止由过度精炼引起的伪影。在最先进的视频生成器上的实验表明,在运动连贯性与物理对齐方面有显著改善,与默认采样器和基于引导的采样器相比,实现了超过 70% 的人类偏好。

关键词

引用

@article{arxiv.2601.18577,
  title  = {Self-Refining Video Sampling},
  author = {Sangwon Jang and Taekyung Ki and Jaehyeong Jo and Saining Xie and Jaehong Yoon and Sung Ju Hwang},
  journal= {arXiv preprint arXiv:2601.18577},
  year   = {2026}
}

备注

ICML 2026. Project page: https://agwmon.github.io/self-refine-video/