中文

多条件图像生成的上下文感知自回归模型

计算机视觉与模式识别 2025-05-20 v1

摘要

自回归变压器最近在图像生成质量和效率方面表现出与最先进扩散模型相当的性能。不同于扩散架构,自回归模型能够自然地将任意模态整合到单一统一的标记序列中,为多条件图像生成任务提供简洁的解决方案。本文提出了ContextAR框架,用于多条件图像生成。ContextAR将多样化条件(如canny边缘、深度图、姿态)直接嵌入标记序列,保留特定模态的语义。为维持空间对齐并增强不同条件类型的辨识度,我们引入混合位置编码,将旋转位置编码与可学习位置编码融合。我们设计条件上下文感知注意力机制以降低计算复杂度,同时保持有效的条件内感知。无需任何微调,ContextAR在推理时间支持任意条件组合。实验结果表明,我们的方法在可控性和通用性方面具有强大能力,性能在多条件驱动场景下与扩散模型方法相媲美,接近现有自回归基线。项目页面:https://context-ar.github.io/。

关键词

引用

@article{arxiv.2505.12274,
  title  = {Context-Aware Autoregressive Models for Multi-Conditional Image Generation},
  author = {Yixiao Chen and Zhiyuan Ma and Guoli Jia and Che Jiang and Jianjun Li and Bowen Zhou},
  journal= {arXiv preprint arXiv:2505.12274},
  year   = {2025}
}