中文

基于Qwen-Image的单步扩散Transformer用于可控现实图像超分辨率

计算机视觉与模式识别 2025-12-01 v3

摘要

近期扩散基现实图像超分辨率(Real-ISR)取得了显著感知质量,但在保真度与可控性之间仍存在问题:多步扩散方法因生成多样性和随机性导致保真度不足,而单步方法因保真度特定微调而丧失控制灵活性。本文提出ODTSR,一种基于Qwen-Image的单步扩散Transformer,同时考虑保真度和可控性进行Real-ISR:新引入的视觉流接收带可调噪声的低质量图像(Control Noise),而原始视觉流接收保持一致噪声的低质量图像(Prior Noise),形成噪声混合视觉流(NVS)设计。ODTSR进一步采用保真度感知对抗训练(FAA)以增强可控性并实现单步推理。大量实验表明,ODTSR不仅在通用Real-ISR上实现最先进(SOTA)性能,还能在挑战性场景如现实世界场景文本图像超分辨率(STISR)的中文字符上实现提示式可控性,无需针对特定数据集进行训练。代码已公开于 https://github.com/RedMediaTech/ODTSR。

关键词

引用

@article{arxiv.2511.17138,
  title  = {One-Step Diffusion Transformer for Controllable Real-World Image Super-Resolution},
  author = {Yushun Fang and Yuxiang Chen and Shibo Yin and Qiang Hu and Jiangchao Yao and Ya Zhang and Xiaoyun Zhang and Yanfeng Wang},
  journal= {arXiv preprint arXiv:2511.17138},
  year   = {2025}
}