中文

I-Diff:用于高保真扩散模型的结构正则化

机器学习 2025-12-17 v3

摘要

去噪扩散概率模型显著推进了生成式 AI,在高质量图像和数据生成方面取得了令人瞩目的成果。然而,在不损害语义内容的前提下提高保真度仍然是该领域的一个关键挑战。多个学科的扩散模型研究引入了新的目标和架构改进,以收紧生成数据分布与真实数据分布之间的匹配,从而产生了比早期生成框架更高的保真度。多阶段架构、物理引导建模、语义条件化和稀有性感知生成都是为实现此任务而探索的一些工作。然而,将数据分布的结构信息整合到 DDPM 中在很大程度上尚未得到探索。传统的 DDPM 框架仅依赖于加性噪声与预测噪声之间的 L2L^2 范数来生成新的数据分布。我们引入了 I-Diff,这是 DDPM 的一个改进版本,它包含一个精心设计的正则化项,有效地使模型能够编码结构信息,从而保留数据分布固有的保真度。通过在多个数据集上对 DDPM、Improved DDPM 和 Latent Diffusion Model 进行大量实验,验证了所提出的方法。实证结果表明,在其他测试数据集上,保真度(在 CIFAR-100 数据集上 Density 和 Precision 分别提升 10% 和 37%)有显著改善。这些结果突显了我们的方法在增强生成数据保真度方面的有效性。值得注意的是,在不同模型上的改进突显了我们所提出的方法在更广泛的生成式 AI 领域中与模型无关的特性。

关键词

引用

@article{arxiv.2403.16790,
  title  = {I-Diff: Structural Regularization for High-Fidelity Diffusion Models},
  author = {Shakthi Perera and Dilum Fernando and H. L. P. Malshan and H. M. P. S. Madushan and Roshan Godaliyadda and M. P. B. Ekanayake and Dhananjaya Jayasundara and Roshan Ragel},
  journal= {arXiv preprint arXiv:2403.16790},
  year   = {2025}
}