中文

基于并行 Token 预测组合的可控图像生成

计算机视觉与模式识别 2026-04-08 v2 机器学习

摘要

条件离散生成模型难以忠实组合多个输入条件。为解决此问题,我们推导出了一种理论上严谨的离散概率生成过程组合公式,以掩码生成(吸收扩散)作为特例。我们的公式能够精确指定训练数据之外的新输入条件组合与数量,并通过概念加权实现对单个条件的强调或否定。结合 VQ-VAE 和 VQ-GAN 丰富的组合式学习词汇,与先前的 SOTA 相比,我们的方法在 3 个数据集(positional CLEVR、relational CLEVR 和 FFHQ)上的错误率平均相对降低了 63.4%63.4\%,同时获得了平均 9.58-9.58 的绝对 FID 改善。此外,我们的方法比同类方法实现了 2.3×2.3\times12×12\times 的实时加速,并且可轻松应用于预训练的离散文本到图像模型,以实现对文本到图像生成的细粒度控制。

关键词

引用

@article{arxiv.2405.06535,
  title  = {Controllable Image Generation with Composed Parallel Token Prediction},
  author = {Jamie Stirling and Noura Al-Moubayed and Chris G. Willcocks and Hubert P. H. Shum},
  journal= {arXiv preprint arXiv:2405.06535},
  year   = {2026}
}

备注

8 pages + references, 7 figures, accepted to CVPR Workshops 2026 (LoViF)