中文

基于改进VQGAN的矢量量化图像建模

计算机视觉与模式识别 2022-06-07 v3 机器学习

摘要

在大规模文本语料上以next-token prediction预训练语言模型,已在生成与判别语言任务中展现出卓越的零样本、少样本、迁移学习与多任务能力。受此启发,我们探索一种矢量量化图像建模(VIM)方法,即预训练一个Transformer以自回归方式预测光栅化图像令牌(token)。离散图像令牌由基于Vision-Transformer的VQGAN(ViT-VQGAN)编码得到。我们首先从架构到码本学习对原始VQGAN提出多项改进,从而获得更好的效率与重建保真度。改进后的ViT-VQGAN进一步提升了矢量量化图像建模任务,包括无条件、类条件图像生成与无监督表示学习。在ImageNet上以 256×256256\times256 分辨率训练时,我们取得Inception Score(IS)175.1与Fr'echet Inception Distance(FID)4.17,相较原始VQGAN(IS与FID分别为70.6与17.04)有显著提升。基于ViT-VQGAN与无监督预训练,我们进一步通过平均中间特征来评估预训练Transformer,类似于Image GPT(iGPT)。该ImageNet预训练的VIM-L在线性探测准确率上以相似模型规模从60.3%大幅击败iGPT-L至73.2%。VIM-L也优于使用额外网络图像数据与更大模型规模训练的iGPT-XL。

关键词

引用

@article{arxiv.2110.04627,
  title  = {Vector-quantized Image Modeling with Improved VQGAN},
  author = {Jiahui Yu and Xin Li and Jing Yu Koh and Han Zhang and Ruoming Pang and James Qin and Alexander Ku and Yuanzhong Xu and Jason Baldridge and Yonghui Wu},
  journal= {arXiv preprint arXiv:2110.04627},
  year   = {2022}
}

备注

Accepted in ICLR 2022