中文

扩展自回归模型用于内容丰富的文本到图像生成

计算机视觉与模式识别 2022-06-23 v1 机器学习

摘要

我们提出 Pathways 自回归文本到图像(Parti)模型,其生成高保真写实图像,并支持涉及复杂组合与世界知识的内容丰富合成。Parti 将文本到图像生成视为序列到序列建模问题,类似于机器翻译,以图像令牌序列作为目标输出,而非另一种语言的文本令牌。该策略可自然利用大型语言模型的大量已有工作,后者已通过扩展数据和模型规模在能力与性能上持续提升。我们的方法简洁:首先,Parti 使用基于 Transformer 的图像分词器 ViT-VQGAN 将图像编码为离散令牌序列。其次,我们将编码器-解码器 Transformer 模型扩展到 200 亿参数,实现一致的质量提升,在 MS-COCO 上取得新的最先进零样本 FID 分数 7.23 和微调 FID 分数 3.22。我们在 Localized Narratives 以及 PartiPrompts(P2,一个包含超过 1600 条英文提示的新整体基准)上的详细分析,展示了 Parti 在广泛类别和难度维度上的有效性。我们也探索并强调模型的局限性,以定义和例证进一步改进的关键重点领域。参见 https://parti.research.google/ 获取高分辨率图像。

关键词

引用

@article{arxiv.2206.10789,
  title  = {Scaling Autoregressive Models for Content-Rich Text-to-Image Generation},
  author = {Jiahui Yu and Yuanzhong Xu and Jing Yu Koh and Thang Luong and Gunjan Baid and Zirui Wang and Vijay Vasudevan and Alexander Ku and Yinfei Yang and Burcu Karagol Ayan and Ben Hutchinson and Wei Han and Zarana Parekh and Xin Li and Han Zhang and Jason Baldridge and Yonghui Wu},
  journal= {arXiv preprint arXiv:2206.10789},
  year   = {2022}
}

备注

Preprint