中文

视觉自回归 Transformer 的通用逼近

机器学习 2025-02-11 v1 人工智能 计算与语言 计算机视觉与模式识别

摘要

我们研究了基于 Transformer 的基础模型的根本限制,将分析扩展到包括视觉自回归 Transformer(VAR)。VAR 表示一种向图像生成迈出的重要步伐,采用一种新颖且可扩展的粗到细的“next-scale prediction”框架。这些模型设定了新的质量标准,超过了包括扩散 Transformer 在内的所有先前方法,在图像合成任务中实现了最先进的性能。我们的主要贡献表明,对于单头 VAR Transformer 仅包含单个自注意力层和单个插值层的模型,VAR Transformer 是通用的。从统计角度来看,我们证明了此类简单的 VAR Transformer 是任何图像到图像 Lipschitz 函数的通用逼近器。此外,我们展示了基于流的自回归 Transformer 继承了类似的逼近能力。我们的结果为有效且计算高效的 VAR Transformer 策略提供了重要的设计原则,可用于将其实用性扩展到更复杂的 VAR 模型,用于图像生成和其他相关领域。

关键词

引用

@article{arxiv.2502.06167,
  title  = {Universal Approximation of Visual Autoregressive Transformers},
  author = {Yifang Chen and Xiaoyu Li and Yingyu Liang and Zhenmei Shi and Zhao Song},
  journal= {arXiv preprint arXiv:2502.06167},
  year   = {2025}
}