链式放大:通过尺度自回归和偏好对齐的极端超分辨率
计算机视觉与模式识别
2026-04-13 v3 人工智能
机器学习
摘要
现代单图像超分辨率 (SISR) 模型在其训练的尺度因子上提供逼真的照片效果,但在要求放大远超该 regime 时会崩溃。我们通过 Chain-of-Zoom (CoZ) 框架克服该可扩展性瓶颈,该框架将 SISR 分解为带多尺度感知提示的分段尺度状态的自回归链。CoZ 重复使用一个 backbone SR 模型,将条件概率分解为可处理的子问题,以实现无需额外训练的极端分辨率。由于高放大倍率下视觉线索会减弱,我们在每个放大步骤中增强多尺度感知文本提示,这些提示由视觉语言模型 (VLM) 生成。提示提取器本身使用广义奖励策略优化 (GRPO) 进行微调,以批准 VLM 对齐文本指导。实验表明,一个标准 4x 扩散 SR 模型包裹在 CoZ 中,可实现超过 256x 的放大,保持高感知质量和保真度。项目页面: https://bryanswkim.github.io/chain-of-zoom/。
引用
@article{arxiv.2505.18600,
title = {Chain-of-Zoom: Extreme Super-Resolution via Scale Autoregression and Preference Alignment},
author = {Bryan Sangwoo Kim and Jeongsol Kim and Jong Chul Ye},
journal= {arXiv preprint arXiv:2505.18600},
year = {2026}
}
备注
NeurIPS 2025 (Spotlight)