ControlVAR:探索可控视觉自回归建模
计算机视觉与模式识别
2024-10-03 v2 人工智能
摘要
条件视觉生成因扩散模型(diffusion models, DMs)的出现在控制到图像生成等任务中取得了显著进展。然而,由于计算成本高昂、推理延迟大以及与大型语言模型(LLMs)集成困难等挑战,亟需探索替代 DMs 的方案。本文引入 ControlVAR,一种新型框架,通过在视觉自回归(VAR)建模中探索像素级控制,实现灵活且高效的条件生成。与传统条件模型仅学习条件分布不同,ControlVAR 在训练期间联合建模图像与像素级条件的分布,并在测试阶段施加条件控制。为提升联合建模效果,本文采用下一尺度自回归预测范式,统一控制与图像表征。提出一种教师强制引导策略以进一步促进联合建模下的可控生成。大量实验表明,ControlVAR 在多种条件生成任务上均优于流行的条件 DMs,如 ControlNet 和 T2I-Adaptor。代码:https://github.com/lxa9867/ControlVAR。
引用
@article{arxiv.2406.09750,
title = {ControlVAR: Exploring Controllable Visual Autoregressive Modeling},
author = {Xiang Li and Kai Qiu and Hao Chen and Jason Kuen and Zhe Lin and Rita Singh and Bhiksha Raj},
journal= {arXiv preprint arXiv:2406.09750},
year = {2024}
}
备注
25 pages, 19 figures, 4 tables