CAR:用于视觉生成的可控自回归建模
计算机视觉与模式识别
2024-10-08 v1
摘要
可控生成允许对生成输出实现细粒度控制,已成为视觉生成模型中的关键关注点。当前,视觉生成的主要技术方法有两种:扩散模型和自回归模型。扩散模型如ControlNet和T2I-Adapter提供了先进的控制机制,而自回归模型尽管在生成质量和可扩展性方面表现突出,但在可控性和灵活性方面仍鲜有探索。在本研究中,我们引入可控自回归建模(CAR),这是一种新型即插即用的框架,将条件控制集成到多尺度潜变量建模中,使其能够在预训练的视觉自回归模型中实现高效的控制生成。CAR逐步细化并捕获控制表示,将其注入预训练模型的每个自回归步骤,以引导生成过程。我们的方法在各种类型的条件下表现出卓越的可控性,并比先前方法实现更高的图像质量。此外,CAR在显著减少的训练资源下实现了鲁妥的泛化,远低于为模型进行预训练所需的资源。鉴于我们是首次为预训练的视觉自回归生成模型提出控制框架,本研究具有重要意义。
引用
@article{arxiv.2410.04671,
title = {CAR: Controllable Autoregressive Modeling for Visual Generation},
author = {Ziyu Yao and Jialin Li and Yifeng Zhou and Yong Liu and Xi Jiang and Chengjie Wang and Feng Zheng and Yuexian Zou and Lei Li},
journal= {arXiv preprint arXiv:2410.04671},
year = {2024}
}
备注
Code available at: https://github.com/MiracleDance/CAR