ScaleWeaver:通过多尺度参考注意力实现高效可控 T2I 生成
计算机视觉与模式识别
2025-10-17 v1
摘要
文本到图像生成使用视觉自回归(VAR)模型最近在生成保真度和推理效率方面取得了显著进展。虽然已探索了扩散模型的控制机制,以实现精确灵活的控制,但在 VAR 框架内实现可控生成仍受到不足的关注。为弥合这一关键缺口,本文我们引入 ScaleWeaver,一种新型框架,旨在通过参数高效微调实现在先进 VAR 模型上的高保真、可控生成。ScaleWeaver 的核心模块是改进的 MMDiT 块,包含提出的 Reference Attention 模块,高效、有效地融合条件信息。不同于常规 MM Attention,提出的 Reference Attention 模块舍弃了不必要的图像条件注意力,从而降低计算成本并稳定控制注入。此外,它战略性地强调参数复用,利用 VAR 主干本身的能力,通过少量引入的参数处理控制信息,并配备一个零初始化线性投影,以确保控制信号有效融合而不干扰基础模型的生成能力。大量实验表明,ScaleWeaver 在保持卓越效率方面,实现了高质量生成和精确控制,优于基于扩散的方法,使 ScaleWeaver 成为视觉自回归范式下可控文本到图像生成的实用且有效的解决方案。代码和模型将发布。
引用
@article{arxiv.2510.14882,
title = {ScaleWeaver: Weaving Efficient Controllable T2I Generation with Multi-Scale Reference Attention},
author = {Keli Liu and Zhendong Wang and Wengang Zhou and Shaodong Xu and Ruixiao Dong and Houqiang Li},
journal= {arXiv preprint arXiv:2510.14882},
year = {2025}
}