中文

不识字的 DALL-E 学会组合

计算机视觉与模式识别 2022-03-16 v3 机器学习

摘要

尽管 DALL-E 在图像生成中展现了基于组合的系统泛化能力,但它需要文本-图像对数据集且组合性由文本提供。相比之下,以对象为中心的表示模型如 Slot Attention 模型无需文本提示即可学习可组合表示。然而,与 DALL-E 不同,其用于零样本生成的系统泛化能力显著受限。本文提出一种简单而新颖的基于槽的自动编码架构,称为 SLATE,以结合两者优点:学习以对象为中心的表示,从而在无文本情况下实现零样本图像生成的系统泛化。因此,该模型也可视为不识字的 DALL-E 模型。与现有以对象为中心的表示模型的像素混合解码器不同,我们提出使用以槽为条件的 Image GPT 解码器来捕捉槽与像素间的复杂交互。实验中,我们表明这种无需文本提示、简单且易于实现的架构在分布内和分布外(零样本)图像生成上取得显著改进,并获得与基于混合解码器的模型定性相当或更好的槽注意力结构。

关键词

引用

@article{arxiv.2110.11405,
  title  = {Illiterate DALL-E Learns to Compose},
  author = {Gautam Singh and Fei Deng and Sungjin Ahn},
  journal= {arXiv preprint arXiv:2110.11405},
  year   = {2022}
}

备注

Published as a conference paper at ICLR 2022