中文

VAR-CLIP:基于视觉自回归建模的文本到图像生成模型

计算机视觉与模式识别 2024-08-05 v1

摘要

VAR 是一种新的生成范式,采用“next-scale prediction”而非“next-token prediction”。这种创新变换使自回归(AR)变换器能够快速学习视觉分布并实现稳健的泛化。然而,原始 VAR 模型仅限于类别条件合成,仅依赖文本标题作为指导。本文提出 VAR-CLIP,一种将视觉自回归技术与 CLIP 能力相结合的文本到图像模型。VAR-CLIP 框架将文本标题编码为文本嵌入,用作图像生成的文本条件。为便于在大规模数据集(如 ImageNet)上训练,我们构建了一个大规模图像-文本数据集,基于 BLIP2。进一步,我们探讨了 CLIP 中单词位置对标题指导的重要性。广泛的实验表明,VAR-CLIP 在生成幻想图像方面表现出高保真度、文本一致性和优异的审美效果。我们的项目页面为 https://github.com/daixiangzi/VAR-CLIP

关键词

引用

@article{arxiv.2408.01181,
  title  = {VAR-CLIP: Text-to-Image Generator with Visual Auto-Regressive Modeling},
  author = {Qian Zhang and Xiangzi Dai and Ninghua Yang and Xiang An and Ziyong Feng and Xingyu Ren},
  journal= {arXiv preprint arXiv:2408.01181},
  year   = {2024}
}

备注

total 10 pages, code:https://github.com/daixiangzi/VAR-CLIP