单一自回归模型的多尺度图像超分辨率
计算机视觉与模式识别
2025-06-06 v1
摘要
本文使用最近的视觉自回归 (VAR) 技术解决图像超分辨率 (ISR) 问题。VAR 不断估计潜在空间中不同尺度之间的残差,称为下一尺度预测。因此,预训练期间学习到的强先验与下游任务 (ISR) 高度吻合。迄今为止,仅 VARSR 利用了这种协同作用,显示出有前景的成果。然而,由于现有残差量化器的局限,VARSR 仅能在固定分辨率下工作,即无法将中间输出映射到相应的图像尺度。此外,它依赖 10 亿参数的 transformer 架构 (VAR-d24),并利用大规模私有数据集实现最先进的结果。我们通过两种新颖组件克服了这些限制:a) 一种层次化图像分词方法,包含一种在不同尺度上逐步表示图像的多尺度图像分词器,同时强制各尺度之间的 token 重叠;b) 一种直接偏好优化 (DPO) 正则化项,其仅依据低分辨率和高分辨率 token 化,鼓励 transformer 生成后者而非前者。据我们了解,这是首次有量化器被训练以在不同尺度上产生语义一致的残差,也是首次使用基于偏好的优化训练 VAR。通过这两个组件,我们的模型可以在单次前向传播中对低分辨率图像进行去噪,并在一半和完整目标升频因子上进行超分辨率。此外,我们在 ISR 上实现了最先进结果,同时使用规模更小的模型(300M 参数 vs VARSR 的 ~1B 参数),且无需使用外部训练数据。
引用
@article{arxiv.2506.04990,
title = {Multi-scale Image Super Resolution with a Single Auto-Regressive Model},
author = {Enrique Sanchez and Isma Hadji and Adrian Bulat and Christos Tzelepis and Brais Martinez and Georgios Tzimiropoulos},
journal= {arXiv preprint arXiv:2506.04990},
year = {2025}
}
备注
Enrique Sanchez and Isma Hadji equally contributed to this work. Project site https://github.com/saic-fi/ms_sr_var