中文

ScrollScape:通过视频扩散先验解锁32K图像生成

计算机视觉与模式识别 2026-04-03 v3

摘要

虽然扩散模型在生成具有常规尺寸的图像方面表现优异,但将其推向极端宽高比比例下超高分辨率图像合成常会触发结构性灾难性失败,如对象重复和空间碎片化。这种限制根本源于缺乏稳健的空间先验,因为静态文本到图像模型主要在常规尺寸图像分布上进行训练。为克服这一瓶颈,我们提出ScrollScape,一种将EAR图像合成重新表述为连续视频生成过程的新框架,具有两个核心创新。通过将大型画布的空间扩张映射到视频帧的时间演化,ScrollScape利用视频模型固有的时序一致性作为强大的全局约束,以确保长程结构完整性。具体而言,扫描位置编码(ScanPE)将全局坐标分布 across frames 以充当灵活移动相机的形式;滚动超分辨率(ScrollSR)利用视频超分辨率先验规避记忆瓶颈,高效扩展输出分辨率至空前的32K。经过在精选的3K多比率图像数据集上微调,ScrollScape有效地将预训练的视频先验与EAR生成任务对齐。广泛的评估表明,它显著优于现有图像扩散基准,消除严重的局部性瑕疵。因此,我们的方法克服了固有的结构瓶颈,确保在极端尺度下跨越 diverse 领域的卓越全局一致性和视觉保真度。

关键词

引用

@article{arxiv.2603.24270,
  title  = {ScrollScape: Unlocking 32K Image Generation With Video Diffusion Priors},
  author = {Haodong Yu and Yabo Zhang and Donglin Di and Ruyi Zhang and Wangmeng Zuo},
  journal= {arXiv preprint arXiv:2603.24270},
  year   = {2026}
}