中文

高效细粒度图像生成的 2 维自回归 Transformer:引燃视觉-语言智能

计算机视觉与模式识别 2024-10-04 v1 人工智能 计算与语言

摘要

本工作通过引入一种新型模型架构——2 维自回归(DnD)Transformer 来解决向量量化(VQ)自回归图像生成中的信息丢失瓶颈。DnD-Transformer 通过在序列长度方向引入新的自回归方向(模型深度)来为图像预测更多符号。与传统 1 维自回归和使用类似 2D 图像分解的先前工作(如 RQ-Transformer)相比,DnD-Transformer 是一个端到端模型,可在相同的 backbone 模型规模和序列长度下生成更高质量的图像,为自回归图像生成开辟了新的优化视角。此外,我们的实验表明,DnD-Transformer 的潜力远超生成自然图像,甚至能在自监督方式下生成包含丰富文本和图形元素的图像,展现出对这些组合模态的理解。这在流行的视觉生成模型(如扩散模型)中尚未实现,显示出仅基于图像训练即可展现视觉-语言智能的火种。代码、数据集和模型均在 https://github.com/chenllliang/DnD-Transformer 开放。

关键词

引用

@article{arxiv.2410.01912,
  title  = {A Spark of Vision-Language Intelligence: 2-Dimensional Autoregressive Transformer for Efficient Finegrained Image Generation},
  author = {Liang Chen and Sinan Tan and Zefan Cai and Weichu Xie and Haozhe Zhao and Yichi Zhang and Junyang Lin and Jinze Bai and Tianyu Liu and Baobao Chang},
  journal= {arXiv preprint arXiv:2410.01912},
  year   = {2024}
}

备注

25 pages, 20 figures, code is open at https://github.com/chenllliang/DnD-Transformer