中文

用于文本到图像生成的仅解码器LLM的综合研究

计算机视觉与模式识别 2025-06-17 v1 人工智能 计算与语言 机器学习

摘要

文本到图像生成与大语言模型(LLMs)均取得了显著进展。然而,许多文本到图像模型仍采用略显过时的T5和CLIP作为其文本编码器。在本工作中,我们研究了使用现代仅解码器LLM作为文本到图像扩散模型文本编码器的有效性。我们构建了一个标准化的训练与评估流水线,使我们能够分离并评估不同文本嵌入的效果。我们使用12种不同的文本编码器训练了总共27个文本到图像模型,以分析LLM中可能影响文本到图像生成的关键方面,包括嵌入提取方法、不同的LLM变体以及模型大小。我们的实验表明,使用最后一层嵌入作为条件的默认方式会导致性能较差。相反,我们探索了来自不同层的嵌入,并发现使用所有层的层归一化平均能显著改善与复杂提示的对齐。大多数采用此条件方式的LLM优于基线T5模型,在高级视觉语言推理技能上表现出增强的性能。

关键词

引用

@article{arxiv.2506.08210,
  title  = {A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation},
  author = {Andrew Z. Wang and Songwei Ge and Tero Karras and Ming-Yu Liu and Yogesh Balaji},
  journal= {arXiv preprint arXiv:2506.08210},
  year   = {2025}
}

备注

CVPR 2025