中文

基于组合并行Token预测的可控图像生成

机器学习 2026-04-08 v1

摘要

条件离散生成模型在忠实组合多个输入条件方面存在困难。为此,我们推导了一个具有理论基础的组合离散概率生成过程的公式化,其中掩码生成(吸收扩散)是其特例。我们的公式化支持对训练数据之外的新颖组合和数量的输入条件进行精确指定,并通过概念加权实现对单个条件的强调或否定。与VQ-VAE和VQ-GAN中丰富的组合性学习词汇协同,我们的方法在三个数据集(位置CLEVR、关系CLEVR和FFHQ)上平均实现了63.4%的相对错误率降低,同时获得了平均绝对FID改善−9.58。此外,我们的方法相比可比方法提供了2.3倍到12倍的实时加速,并且可以方便地应用于一个开源预训练的离散文本到图像模型,以实现细粒度的文本到图像生成控制。

关键词

引用

@article{arxiv.2604.05730,
  title  = {Controllable Image Generation with Composed Parallel Token Prediction},
  author = {Jamie Stirling and Noura Al-Moubayed and Chris G. Willcocks and Hubert P. H. Shum},
  journal= {arXiv preprint arXiv:2604.05730},
  year   = {2026}
}

备注

8 pages + references, 7 figures, accepted to CVPR Workshops 2026 (LoViF). arXiv admin note: substantial text overlap with arXiv:2405.06535