GIVT:生成式无限词表 Transformer
计算机视觉与模式识别
2024-07-18 v4
摘要
我们引入了生成式无限词表 Transformer(GIVT),它生成具有实值条目的向量序列,而不是来自有限词表的离散 token。为此,我们对仅解码器 Transformer 提出了两项令人惊讶的简单修改:1)在输入端,我们用输入向量的线性投影替换了有限词表查找表;2)在输出端,我们用多元高斯混合模型的参数替换了 logits 预测(通常映射到分类分布)。受 VQ-GAN 和 MaskGIT 的图像生成范式启发(其中 Transformer 用于建模 VQ-VAE 的离散潜在序列),我们使用 GIVT 来建模 -VAE 的未量化实值潜在序列。在类条件图像生成中,GIVT 优于 VQ-GAN(及其改进变体)以及 MaskGIT,并取得了与最近的潜在扩散模型相媲美的性能。最后,当将 GIVT 应用于 UViM 框架的 VAE 变体进行全景分割和深度估计时,我们在图像生成之外获得了强劲的结果。
引用
@article{arxiv.2312.02116,
title = {GIVT: Generative Infinite-Vocabulary Transformers},
author = {Michael Tschannen and Cian Eastwood and Fabian Mentzer},
journal= {arXiv preprint arXiv:2312.02116},
year = {2024}
}
备注
v2: add related NLP work, loss details. v3: Improved GMM formulation, added adapter module, larger models, better image generation results. v4: ECCV 2024 camera ready version (minor changes). Code and model checkpoints are available at: https://github.com/google-research/big_vision