中文

SCALAR: 尺度可控的视觉自回归学习

计算机视觉与模式识别 2025-11-18 v3

摘要

可控图像合成能够对生成输出进行细粒度控制,已成为视觉生成建模的一个关键焦点。然而,由于视觉自回归(VAR)模型采用分层的、下一尺度预测的风格,可控生成对其仍然具有挑战性。现有的基于 VAR 的方法常常受到低效的控制编码和破坏性的注入机制的困扰,这损害了保真度和效率。在这项工作中,我们提出了 SCALAR,一种基于 VAR 的可控生成方法,它融合了一种新颖的尺度条件解码机制。SCALAR 利用预训练的图像编码器提取语义控制信号编码,这些编码被投影为尺度特定的表征,并注入到 VAR 主干网络的相应层中。这种设计在整个生成过程中提供了持久且结构对齐的指导。基于 SCALAR,我们开发了 SCALAR-Uni,一个统一的扩展,它将多种控制模态对齐到一个共享的潜在空间中,支持在单个模型中进行灵活的多条件引导。大量实验表明,SCALAR 在各种任务中实现了卓越的生成质量和控制精度。代码发布于 https://github.com/AMAP-ML/SCALAR。

关键词

引用

@article{arxiv.2507.19946,
  title  = {SCALAR: Scale-wise Controllable Visual Autoregressive Learning},
  author = {Ryan Xu and Dongyang Jin and Yancheng Bai and Rui Lan and Xu Duan and Lei Sun and Xiangxiang Chu},
  journal= {arXiv preprint arXiv:2507.19946},
  year   = {2025}
}