中文

阐明用于图像生成的语言模型的设计空间

计算机视觉与模式识别 2024-10-22 v1

摘要

自回归(AR)语言模型在文本生成中的成功启发了计算机视觉界采用大型语言模型(LLMs)进行图像生成。然而,考虑到文本和图像模态之间的本质差异,用于图像生成的语言模型的设计空间仍未得到充分探索。我们观察到,与文本标记相比,图像标记表现出更大的随机性,这给使用标记预测进行训练带来了挑战。尽管如此,AR模型通过即使从看似次优的优化问题中也能有效学习模式,展示了其潜力。我们的分析还揭示,虽然所有模型都成功掌握了局部信息在图像生成中的重要性,但较小的模型难以捕捉全局上下文。相比之下,较大的模型在这方面展示了改进的能力,这有助于解释在扩大模型规模时获得的性能提升。我们通过广泛的对比实验,进一步阐明了用于视觉生成的语言模型的设计空间,包括分词器选择、模型选择、模型可扩展性、词汇表设计和采样策略。我们的工作是首次分析语言模型在视觉生成中的优化行为,我们相信它可以启发将语言模型应用于其他领域时更有效的设计。最后,我们阐明的用于图像生成的语言模型,称为ELM,在ImageNet 256*256基准测试上实现了最先进的性能。代码可在 https://github.com/Pepperlll/LMforImageGeneration.git 获取。

关键词

引用

@article{arxiv.2410.16257,
  title  = {Elucidating the design space of language models for image generation},
  author = {Xuantong Liu and Shaozhe Hao and Xianbiao Qi and Tianyang Hu and Jun Wang and Rong Xiao and Yuan Yao},
  journal= {arXiv preprint arXiv:2410.16257},
  year   = {2024}
}

备注

Project page: https://pepper-lll.github.io/LMforImageGeneration/