中文

JetFormer:原始图像和文本的自回归生成模型

机器学习 2025-05-20 v2 人工智能 计算机视觉与模式识别

摘要

消除建模约束并统一跨域架构是大型多模态模型训练进步的关键驱动力。然而,这些模型仍依赖许多独立训练的组件,如模态特定的编码器和解码器。本文进一步简化图像和文本联合生成建模。我们提出一种自回归解码器-only transformer - JetFormer - 通过直接最大化原始数据的似然概率进行训练,不依赖任何独立预训练组件,能够理解和生成文本和图像。具体而言,我们利用正规化流模型获取软标记图像表示,并与自回归多模态 transformer 联合训练。正规化流模型在推断过程中既作为图像编码器用于感知任务,也作为图像解码器用于图像生成任务。JetFormer 在文本到图像生成质量方面与最新基于 VQ-VAE 和 VAE 的基线方法相称。这些基线方法依赖预训练的图像自动编码器,该自动编码器采用包括感知损失在内的复杂混合损失进行训练。与此同时,JetFormer 也表现出稳健的图像理解能力。据我们了解,JetFormer 是首个能够生成高保真图像并产生强日志似然下界的模型。

关键词

引用

@article{arxiv.2411.19722,
  title  = {JetFormer: An Autoregressive Generative Model of Raw Images and Text},
  author = {Michael Tschannen and André Susano Pinto and Alexander Kolesnikov},
  journal= {arXiv preprint arXiv:2411.19722},
  year   = {2025}
}

备注

ICLR 2025. Code available at https://github.com/google-research/big_vision