分布条件生成:从类别分布到创意生成
计算机视觉与模式识别
2025-05-07 v1
摘要
文本到图像 (T2I) 扩散模型能有效生成语义对齐的图像,但它们对训练数据分布的依赖限制了其合成真正新颖的、分布外概念的能力。现有方法通常通过组合已知概念对来增强创造力,产生的组合虽然属于分布外,但在语言上仍可描述,并局限于现有的语义空间内。受分类器在模糊输入上的软概率输出启发,我们提出了分布条件生成,这是一种新颖的公式,将创意建模为以类别分布为条件的图像合成,从而实现语义无约束的创意生成。在此基础上,我们提出了 DisTok,一个编码器-解码器框架,它将类别分布映射到潜在空间,并将其解码为创意概念的令牌。DisTok 维护一个动态概念池,并迭代采样和融合概念对,从而能够生成与日益复杂的类别分布对齐的令牌。为了强制分布一致性,从高斯先验中采样的潜在向量被解码为令牌并渲染成图像,其类别分布(由视觉-语言模型预测)监督输入分布与生成令牌的视觉语义之间的对齐。生成的令牌被添加到概念池中以供后续组合。大量实验表明,DisTok 通过统一分布条件融合和基于采样的合成,实现了高效且灵活的令牌级生成,在文本-图像对齐和人类偏好评分方面达到了最先进的性能。
引用
@article{arxiv.2505.03667,
title = {Distribution-Conditional Generation: From Class Distribution to Creative Generation},
author = {Fu Feng and Yucheng Xie and Xu Yang and Jing Wang and Xin Geng},
journal= {arXiv preprint arXiv:2505.03667},
year = {2025}
}