中文

情境的力量:多模态方法如何提升图像超分辨率

计算机视觉与模式识别 2025-03-19 v1 人工智能 机器学习

摘要

单图像超分辨率(SISR)由于从低分辨率输入中恢复细粒度细节和保持感知质量的固有困难,仍然具有挑战性。现有方法常依赖有限的图像先验,导致结果次优。我们提出一种新方法,利用深度、分割、边缘和文本提示等多种模态中可获取的丰富上下文信息,在扩散模型框架内学习强大的生成式先验。我们引入一种灵活的网络架构,有效融合多模态信息,可支持任意数量的输入模态,且无需对扩散过程进行显著修改。关键在于,通过利用其他模态的空间信息指导区域文本条件化,减轻了文本提示常导致的幻觉问题。每种模态的指导强度也可以独立控制,允许通过深度增加背景景深,或通过分割调整物体显现程度等不同方向引导输出。大量实验表明,我们的模型超越了当前最先进的生成式SISR方法,实现了卓越的视觉质量和保真度。项目页面请访问 https://mmsr.kfmei.com/。

引用

@article{arxiv.2503.14503,
  title  = {The Power of Context: How Multimodality Improves Image Super-Resolution},
  author = {Kangfu Mei and Hossein Talebi and Mojtaba Ardakani and Vishal M. Patel and Peyman Milanfar and Mauricio Delbracio},
  journal= {arXiv preprint arXiv:2503.14503},
  year   = {2025}
}

备注

accepted by CVPR2025