粗粒度 KL 控制的扩散生成式 AI
机器学习
2026-01-07 v2
摘要
扩散模型和基于分数的生成模型提供了一种从噪声合成高质量图像的强大框架。然而,仍不存在令人满意的理论来描述在将图像划分为空间块后,如块级强度或类别比例等粗粒度量如何在逆扩散动力学中得到保存和演化。在先前的工作中,作者引入了一种用于非平稳马尔可夫过程的信噪比 Lyapunov 函数 V,该过程在划分为块的状态空间上进行,定义为到从给定初始条件可到达的平稳分布集合的最小 Kullback-Leibler 发散。我们证明了具有给定块质量容忍容限的漏洞容忍潜势 V-δ 可表示为块质量的比例与裁剪操作的闭形式表达式。在本文中,我们将该框架移植到生成模型中的逆扩散过程,提出一种由潜势 V-δ 所投影的逆扩散方案(称为 V-δ 投影逆扩散)。我们扩展了 V 对时间非齐次块保持马尔可夫核的单调性,并在小漏洞和 V-δ 投影条件下,证明 V-δ 充当近似 Lyapunov 函数。此外,我们使用由块常数图像和简化逆核构成的 toy 模型,数值演示了所提出方法在保持块质量误差和漏洞容忍潜势在给定容限内,同时实现与非投影动力学相当的像素级精度和视觉质量。该研究重新诠释了生成采样作为从噪声到数据的信息潜势的减小过程,为具有显式粗粒度量控制的逆扩散过程提供了设计原则。
引用
@article{arxiv.2601.01045,
title = {Coarse-Grained Kullback--Leibler Control of Diffusion-Based Generative AI},
author = {Tatsuaki Tsuruyama},
journal= {arXiv preprint arXiv:2601.01045},
year = {2026}
}