中文

AlignVAR:面向图像超分辨的全局一致视觉自回归

计算机视觉与模式识别 2026-03-06 v2 人工智能

摘要

视觉自回归(VAR)模型近期作为一种新兴的图像生成替代方案,凭借稳定训练、非迭代推理及通过尺度预测实现的高保真合成,展现出巨大的潜力。鼓励将VAR用于图像超分辨(ISR),但其应用仍鲜有探索,面临两大关键挑战:一是局域性偏置注意力导致空间结构碎片化,二是仅用残差监督导致尺度间误差累积,严重损害重建图像的全局一致性。为此,我们提出AlignVAR——为ISR设计的全局一致视觉自回归框架,包含两个关键组件:(1)空间一致性自回归(SCA),通过自适应掩码对注意力进行加权,聚焦于结构关联区域,从而缓解过度局域化,增强长程依赖;(2)层次一致性约束(HCC),在每个尺度上补充完整重建监督,以早期暴露累积偏差,稳定粗到细的细化过程。大量实验表明,AlignVAR在结构连贯性与感知保真度方面持续优于现有生成方法,同时实现推理速度提升十倍以上、参数数量减少近50%,为高效ISR建立了新范式。

关键词

引用

@article{arxiv.2603.00589,
  title  = {AlignVAR: Towards Globally Consistent Visual Autoregression for Image Super-Resolution},
  author = {Cencen Liu and Dongyang Zhang and Wen Yin and Jielei Wang and Tianyu Li and Ji Guo and Wenbo Jiang and Guoqing Wang and Guoming Lu},
  journal= {arXiv preprint arXiv:2603.00589},
  year   = {2026}
}

备注

Accepted to CVPR 2026 Findings