中文

CreativeVR:用于生成视频与真实视频结构与运动恢复的扩散先验引导方法

计算机视觉与模式识别 2025-12-16 v1 机器学习 多媒体

摘要

现代文本到视频 (T2V) 扩散模型能够合成视觉上引人注目的片段,但在细粒度结构上仍然脆弱:即使是最先进的生成器也经常产生扭曲的面部和手部、变形的背景以及时间上不一致的运动。这种严重的结构伪影也出现在极低质量的现实世界视频中。相比之下,经典的视频恢复和超分辨率 (VR/VSR) 方法针对模糊和下采样等合成退化进行调整,倾向于稳定这些伪影而不是修复它们,而扩散先验恢复器通常在光度噪声上训练,几乎无法控制感知质量与保真度之间的权衡。我们引入了 CreativeVR,这是一个扩散先验引导的视频恢复框架,用于具有严重结构和时间伪影的 AI 生成 (AIGC) 和真实视频。我们基于深度适配器的方法提供了一个单一的精度旋钮,控制模型多大程度上遵循输入,在标准退化上的精确恢复与具有挑战性内容上更强的结构和运动纠正行为之间平滑权衡。我们的关键创新是训练期间使用的时间相干退化模块,该模块应用了精心设计的变换以产生逼真的结构失效。为了评估 AIGC 伪影恢复,我们提出了包含 FIQA、语义和感知指标以及多方面评分的 AIGC54 基准。CreativeVR 在具有严重伪影的视频上取得了最先进的结果,并在标准视频恢复基准上具有竞争力,同时以实用的吞吐量运行(在单张 80-GB A100 上 720p 分辨率约为 13 FPS)。项目页面:https://daveishan.github.io/creativevr-webpage/。

关键词

引用

@article{arxiv.2512.12060,
  title  = {CreativeVR: Diffusion-Prior-Guided Approach for Structure and Motion Restoration in Generative and Real Videos},
  author = {Tejas Panambur and Ishan Rajendrakumar Dave and Chongjian Ge and Ersin Yumer and Xue Bai},
  journal= {arXiv preprint arXiv:2512.12060},
  year   = {2025}
}

备注

The first two authors contributed equally