中文

基于先验正则化的 4K 图像到视频扩散:FrescoDiffusion

计算机视觉与模式识别 2026-03-19 v1 人工智能

摘要

基于扩散的图像到视频(I2V)模型日益有效,但在处理超高分辨率输入(如 4K)时仍面临挑战。生成视频的模型本生分辨率常常丢失细粒度结构,而高分辨率拼接去噪保留局部细节但破坏全局布局一致性。这种失效模式在壁画动画场景中尤为严重:那些包含许多不同角色、物体和语义不同子场景的巨型艺术品必须在时间内保持空间一致性。我们引入 FrescoDiffusion,一种用于从单个复杂图像生成连贯大格式 I2V 的无训练方法。关键思想是通过预计算的潜在先验来增强拼接去噪:我们首先在底层模型分辨率下生成低分辨率视频,并上采样其潜在轨迹以获得全局参考,以捕获长程时空结构。对于 4K 生成,我们在每个扩散时间步计算每个瓷砖的噪声预测,并通过最小化模型输出空间中单个加权最小二乘目标来将其与参考融合。该目标结合了标准拼接准则与我们的正则化项,产生闭式融合更新,以强化全局一致性同时保留细节。我们另提供空间正则化变量,使能够对运动允许的区域进行区域级别控制。在 VBench-I2V 数据集和我们提出的壁画 I2V 数据集上的实验表明,与拼接基线相比,我们在全局一致性和保真度方面取得了改进,同时保持计算效率。我们的正则化使能够显式控制创造性与一致性之间的权衡。

关键词

引用

@article{arxiv.2603.17555,
  title  = {FrescoDiffusion: 4K Image-to-Video with Prior-Regularized Tiled Diffusion},
  author = {Hugo Caselles-Dupré and Mathis Koroglu and Guillaume Jeanneret and Arnaud Dapogny and Matthieu Cord},
  journal= {arXiv preprint arXiv:2603.17555},
  year   = {2026}
}

备注

5 authors. Hugo Caselles-Dupr\'e, Mathis Koroglu, and Guillaume Jeanneret contributed equally. 14 pages, 7 figures