中文

DreamSR:通过感受野增强的扩散Transformer实现超高分辨率图像超分辨率

计算机视觉与模式识别 2026-05-18 v1

摘要

大规模预训练扩散模型因其通过文本引导的强大生成先验,已被广泛用于真实世界图像超分辨率。然而,当使用分块推理策略对高分辨率图像进行超分辨率处理时,由于来自低分辨率图像的全局提示与每个推理步骤中局部块的不完整语义信息之间的不对齐,大多数现有的基于扩散的超分辨率方法往往会出现过度生成的问题。另一方面,由于网络设计和训练策略中过度强调全局生成能力,大多数现有方法也未能生成局部块中的细节纹理。为解决此问题,我们提出DreamSR,一种新颖的超分辨率模型,该模型抑制局部过度生成并改善细节合成,从而实现具有超高质量细节的视觉保真结果。具体来说,我们提出一个双分支MM-ControlNet,其中ControlNet利用块级提示生成局部文本特征,而预训练的DiT则利用全局提示提供全局文本特征,从而缓解过度生成并确保跨块的语义一致性。我们还设计了一个包含分阶段数据处理流程和感受野增强策略的综合训练策略,增强了模型捕获块信息并有效恢复局部纹理的能力。大量实验表明,DreamSR优于最先进的方法,提供了高质量的超分辨率结果。代码和模型可在 https://github.com/jerrydong0219/DreamSR 获取。

关键词

引用

@article{arxiv.2605.15682,
  title  = {DreamSR: Towards Ultra-High-Resolution Image Super-Resolution via a Receptive-Field Enhanced Diffusion Transformer},
  author = {Qingji Dong and Hang Dong and Mingqin Chen and Rui Zhang and Yitong Wang},
  journal= {arXiv preprint arXiv:2605.15682},
  year   = {2026}
}