中文

感知、理解与恢复:基于自回归多模态生成模型的真实世界图像超分辨率

计算机视觉与模式识别 2025-03-17 v1

摘要

通过利用预训练文本到图像扩散模型的生成先验,真实世界图像超分辨率在复杂和/或严重退化场景中往往会产生不准确且不自然的重建结果,这主要由于其对输入低质量图像的感知和理解能力有限。为了解决这些局限性,据我们所知,我们首次提出将预训练的自回归多模态模型(如 Lumina-mGPT)适配为鲁棒的真实世界图像超分辨率模型,即 PURE,该模型感知并理解输入低质量图像,然后恢复其对应的高质量图像。具体而言,我们在 Lumina-mGPT 上实施指令微调,以感知图像退化程度以及先前生成的图像 token 与下一个 token 之间的关系,通过生成图像语义描述来理解图像内容,并随后利用收集到的信息自回归地生成高质量图像 token 以恢复图像。此外,我们揭示了图像 token 熵反映了图像结构,并提出了一种基于熵的 Top-k 采样策略,以在推理过程中优化图像的局部结构。实验结果表明,PURE 在生成逼真细节的同时保留了图像内容,特别是在具有多个物体的复杂场景中,展示了自回归多模态生成模型在鲁棒真实世界图像超分辨率方面的潜力。模型和代码将发布于 https://github.com/nonwhy/PURE。

关键词

引用

@article{arxiv.2503.11073,
  title  = {Perceive, Understand and Restore: Real-World Image Super-Resolution with Autoregressive Multimodal Generative Models},
  author = {Hongyang Wei and Shuaizheng Liu and Chun Yuan and Lei Zhang},
  journal= {arXiv preprint arXiv:2503.11073},
  year   = {2025}
}