中文

基于 Transformer 的空间可控图像生成实用研究

计算机视觉与模式识别 2025-11-05 v2

摘要

使图像生成模型具备空间可控能力是一个重要的研究领域,它使用户能够通过边缘图、姿态等精细规格更好地生成图像。尽管该任务近年来取得了显著进展,但快速生成更强模型的目标却以牺牲详细且公平的科学比较为代价。不同的训练数据、模型架构和生成范式使得难以厘清影响性能的因素。同时,某些方法的动机和细微差别在文献中变得模糊。本文旨在为希望开发基于 Transformer 的空间可控生成系统的从业者提供跨生成范式的清晰结论,澄清文献并填补知识空白。我们在 ImageNet 上对基于扩散、基于流和自回归 (AR) 模型进行了受控实验。首先,我们确立了控制令牌预填充作为一种简单、通用且性能优异的基线方法。接着,我们研究了此前未被充分探索的采样时增强技术,表明将无分类器引导扩展到控制以及 softmax 截断对控制-生成一致性有显著影响。最后,我们重新阐明了基于适配器方法的动机,证明它们在有限下游数据上训练时能缓解“遗忘”并保持生成质量,但在生成-控制一致性方面不如完整训练。

关键词

引用

@article{arxiv.2507.15724,
  title  = {A Practical Investigation of Spatially-Controlled Image Generation with Transformers},
  author = {Guoxuan Xia and Harleen Hanspal and Petru-Daniel Tudosiu and Shifeng Zhang and Sarah Parisot},
  journal= {arXiv preprint arXiv:2507.15724},
  year   = {2025}
}

备注

TMLR https://openreview.net/forum?id=loT6xhgLYK