中文

ControlAR:用于可控图像生成的自回归模型

计算机视觉与模式识别 2025-03-11 v3

摘要

自回归(AR)模型已通过将图像生成重新表述为下一个标记预测,展现出巨大的潜力并成为扩散模型的强大竞争者。然而,在AR模型中,类似ControlNet的控制到图像生成仍主要未被探索。虽然一种自然的做法是将控制图像标记化并在解码图像标记之前预填充它们,但这仍不足以实现与ControlNet相当的生成质量,且存在效率问题。为此,我们引入ControlAR,这是一个高效且有效的框架,用于将空间控制集成到自回归图像生成模型中。首先,我们探索了AR模型的控制编码方法,提出了一种轻量级控制编码器,用于将空间输入(例如,canny边缘或深度图)转换为控制标记。然后ControlAR利用条件解码方法生成下一个图像标记,条件为控制标记与图像标记之间的逐标记融合,类似于位置编码。与预填充标记相比,使用条件解码显著增强了AR模型的控制能力,同时保持了模型的效率。此外,提出的ControlAR surprisingly 使AR模型能够通过条件解码和特定控制实现任意分辨率图像生成。广泛的实验结果表明,ControlAR在各种输入(包括边缘、深度和分段掩码)上的可控自回归图像生成具有良好的可控性。此外,定量和定性结果表明,ControlAR超越了以往的状态-of-the-art可控扩散模型,如ControlNet++。代码、模型和演示将很快在https://github.com/hustvl/ControlAR上提供。

关键词

引用

@article{arxiv.2410.02705,
  title  = {ControlAR: Controllable Image Generation with Autoregressive Models},
  author = {Zongming Li and Tianheng Cheng and Shoufa Chen and Peize Sun and Haocheng Shen and Longjin Ran and Xiaoxin Chen and Wenyu Liu and Xinggang Wang},
  journal= {arXiv preprint arXiv:2410.02705},
  year   = {2025}
}

备注

To appear in ICLR 2025