基于并行 Token 预测组合的可控图像生成
计算机视觉与模式识别
2026-04-08 v2 机器学习
摘要
条件离散生成模型难以忠实组合多个输入条件。为解决此问题,我们推导出了一种理论上严谨的离散概率生成过程组合公式,以掩码生成(吸收扩散)作为特例。我们的公式能够精确指定训练数据之外的新输入条件组合与数量,并通过概念加权实现对单个条件的强调或否定。结合 VQ-VAE 和 VQ-GAN 丰富的组合式学习词汇,与先前的 SOTA 相比,我们的方法在 3 个数据集(positional CLEVR、relational CLEVR 和 FFHQ)上的错误率平均相对降低了 ,同时获得了平均 的绝对 FID 改善。此外,我们的方法比同类方法实现了 至 的实时加速,并且可轻松应用于预训练的离散文本到图像模型,以实现对文本到图像生成的细粒度控制。
引用
@article{arxiv.2405.06535,
title = {Controllable Image Generation with Composed Parallel Token Prediction},
author = {Jamie Stirling and Noura Al-Moubayed and Chris G. Willcocks and Hubert P. H. Shum},
journal= {arXiv preprint arXiv:2405.06535},
year = {2026}
}
备注
8 pages + references, 7 figures, accepted to CVPR Workshops 2026 (LoViF)