中文

通过自回归表示对齐释放大型语言模型在文本到图像生成中的潜力

计算机视觉与模式识别 2025-11-17 v4

摘要

我们提出了自回归表示对齐,一种新的训练框架,无需架构修改即可在自回归 LLM 中解锁全局连贯的文本到图像生成。与需要复杂架构重新设计的先前工作不同,ARRA 通过全局视觉对齐损失和混合标记 <HYBNEXT> 将 LLM 的隐藏状态与来自外部视觉基础模型的视觉表示对齐。该标记实施双重约束:局部下一标记预测和全局语义蒸馏,使 LLM 能够隐式学习空间和上下文连贯性,同时保留其原始的自回归范式。大量实验验证了 ARRA 的即插即用通用性。当从零开始训练 T2I LLM 时,对于像 LlamaGen 这样的自回归 LLM,ARRA 在不修改原始架构和推理机制的情况下,将 ImageNet 上的 FID 降低了 16.6%,LAION-COCO 上降低了 12.0%。对于从纯文本生成 LLM 进行训练,对于像 Chameleon 这样的高级 LLM,ARRA 将 MIMIC-CXR 上的 FID 降低了 25.5%,DeepEyeNet 上降低了 8.8%。对于领域适应,ARRA 将通用 LLM 与专用模型(例如 BioMedCLIP)对齐,在医学成像(MIMIC-CXR)上比直接微调实现了 18.6% 的 FID 降低。这些结果表明,训练目标重设计而非架构修改可以解决跨模态全局连贯性挑战。ARRA 为推进自回归模型提供了一种互补范式。代码可在 https://github.com/HKU-HealthAI/ARRA 获取。

关键词

引用

@article{arxiv.2503.07334,
  title  = {Unleashing the Potential of Large Language Models for Text-to-Image Generation through Autoregressive Representation Alignment},
  author = {Xing Xie and Jiawei Liu and Ziyue Lin and Huijie Fan and Zhi Han and Yandong Tang and Liangqiong Qu},
  journal= {arXiv preprint arXiv:2503.07334},
  year   = {2025}
}

备注

Accepted by AAAI 2026 Oral