用于多尺度图像超分辨率的分层图像分词
计算机视觉与模式识别
2026-05-15 v1
摘要
我们引入了一种多尺度图像超分辨率 (ISR) 方法,该方法建立在视觉自回归 (VAR) 建模的最新进展之上。VAR 模型利用残差量化 (RQ) 将图像分词分解为加性的、逐渐增大的尺度,这一方法与我们的目标 ISR 任务完美契合。以往利用这种协同作用的工作存在两个主要缺点。首先,由于 RQ 的局限性,它们只能在预定义的固定尺度下生成图像,无法将中间输出映射到相应的图像尺度。它们还依赖大型骨干网络或大量标注数据语料库来实现更好的性能。为了解决这两个缺点,我们在用于 ISR 的 VAR 训练中引入了两个新颖的组件,旨在提高其灵活性并降低其复杂性。具体而言,我们引入了 a) 一种 \textbf{分层图像分词 (HIT)} 方法,该方法在不同尺度上逐步表示图像,同时强制执行跨尺度的 token 重叠;以及 b) 一个 \textbf{直接偏好优化 (DPO) 正则化项},该项仅依赖 (LR,HR) 对,鼓励 Transformer 生成后者而非前者。我们提出的 HIT 作为 VAR 训练的强归纳偏置,产生了一个小模型(300M 参数对比 VARSR 的 1B 参数),该模型在没有外部训练数据的情况下取得了 SOTA 结果,并且仅需单次前向传播即可输出多尺度结果。
引用
@article{arxiv.2605.14891,
title = {Hierarchical Image Tokenization for Multi-Scale Image Super Resolution},
author = {Isma Hadji and Enrique Sanchez and Adrian Bulat and Brais Martinez and Georgios Tzimiropoulos},
journal= {arXiv preprint arXiv:2605.14891},
year = {2026}
}
备注
Accepted for publication at ICML 2026. *Joint first authorship (alphabetical order). arXiv admin note: substantial text overlap with arXiv:2506.04990