中文

Switti:用于文本到图像合成的尺度级 Transformer 设计

计算机视觉与模式识别 2025-03-21 v4

摘要

本 work 提出 Switti,这是一种用于文本到图像生成的尺度级 transformer。我们首先改造现有的自回归 (AR) 架构以适用于 T2I 生成,并在此过程中探讨并缓解训练稳定性问题。随后,我们指出尺度级 transformer 不需要因果约束,提出一种非因果版本,实现约 21% 更快的采样速度和更低的内存占用,同时在生成质量上也略有提升。进一步地,我们发现高分辨率尺度上的分类器自由指南往往是不必要的,甚至可能降低性能。通过在这些尺度上禁用指南,我们实现了约 32% 的额外采样加速,并提升了细粒度细节的生成。广泛的人类偏好研究和自动评估表明,Switti 在 T2I AR 模型方面表现优异,并能与最先进的 T2I 扩散模型竞争,同时速度提升最高可达 7 倍。

关键词

引用

@article{arxiv.2412.01819,
  title  = {Switti: Designing Scale-Wise Transformers for Text-to-Image Synthesis},
  author = {Anton Voronov and Denis Kuznedelev and Mikhail Khoroshikh and Valentin Khrulkov and Dmitry Baranchuk},
  journal= {arXiv preprint arXiv:2412.01819},
  year   = {2025}
}

备注

CVPR 2025