中文

M-VAR:用于高质量图像生成的解耦尺度级自回归建模

计算机视觉与模式识别 2024-11-18 v1

摘要

计算机视觉领域近期出现名为 VAR 的工作,提出了一种用于图像生成的新自回归范式。不同于原版的下一 token 预测,VAR 将图像生成在结构上重构为从粗到细的下一尺度预测。本文表明,这种尺度级自回归框架可有效解耦为“尺度内建模”(捕捉各尺度内的局部空间依赖)与“尺度间建模”(从粗到细渐进地建模跨尺度关系)。这种解耦结构允许以更计算高效的方式重构 VAR。具体而言,对生成高保真图像至关重要的尺度内建模,我们保留原始的双向自注意力设计以确保全面建模;而语义连接不同尺度但计算密集的尺度间建模,我们采用 Mamba 等线性复杂度机制大幅降低计算开销。我们称这一新框架为 M-VAR。大量实验表明,该方法在图像质量与生成速度上均优于现有模型。例如,我们的 1.5B 模型以更少参数和更快推理速度超越了最大的 VAR-d30-2B。此外,我们的最大模型 M-VAR-d32 在 ImageNet 256×256 上令人印象深刻地达到 1.78 FID,分别比先进自回归模型 LlamaGen/VAR 优越 0.4/0.19,比流行扩散模型 LDM/DiT 优越 1.82/0.49。代码可在 https://github.com/OliverRensu/MVAR 获取。

关键词

引用

@article{arxiv.2411.10433,
  title  = {M-VAR: Decoupled Scale-wise Autoregressive Modeling for High-Quality Image Generation},
  author = {Sucheng Ren and Yaodong Yu and Nataniel Ruiz and Feng Wang and Alan Yuille and Cihang Xie},
  journal= {arXiv preprint arXiv:2411.10433},
  year   = {2024}
}