基于优化的视觉反演:一种免训练的文本到图像生成扩散先验
计算机视觉与模式识别
2025-12-30 v3 人工智能
计算与语言
机器学习
摘要
扩散模型已在文本到图像生成领域确立了最先进的地位,但其性能通常依赖于一个扩散先验网络,将文本嵌入转换到视觉流形以便于解码。这些先验计算成本高昂,且需要在大规模数据集上进行大量训练。本文中,我们通过采用基于优化的视觉反演(Optimization-based Visual Inversion, OVI)——一种免训练且零样本的替代方案——来完全挑战训练先验的必要性。OVI 从随机伪标记初始化一个潜在视觉表示,并迭代优化它以最大化与输入文本提示嵌入的余弦相似度。我们进一步提出了两种新颖的约束条件,即基于马氏距离的损失和最近邻损失,以将 OVI 优化过程正则化到真实图像的分布上。我们在 Kandinsky 2.2 上进行的实验表明,OVI 可以作为传统先验的替代方案。更重要的是,我们的分析揭示了当前评估基准(如 T2I-CompBench++)的一个关键缺陷:尽管感知质量较低,但仅使用文本嵌入作为先验就能获得惊人的高分。我们的约束 OVI 方法在此基线上提高了视觉保真度,其中最近邻方法被证明特别有效。它取得了与最先进的数据高效先验相当或更高的量化分数,凸显了基于优化的策略作为传统先验的可行、免训练替代方案的潜力。代码将在录用后公开。
引用
@article{arxiv.2511.20821,
title = {Training-Free Diffusion Priors for Text-to-Image Generation via Optimization-based Visual Inversion},
author = {Samuele Dell'Erba and Andrew D. Bagdanov},
journal= {arXiv preprint arXiv:2511.20821},
year = {2025}
}
备注
13 pages, 7 figures, technical report (preprint)