中文

卷积扩散模型中创造力的分析理论

机器学习 2025-06-06 v2 无序系统与神经网络 人工智能 神经元与认知 机器学习

摘要

我们获得了卷积扩散模型中创造力的分析性、可解释且可预测的理论。实际上,得分匹配扩散模型可以生成高度原创的图像,这些图像远离其训练数据。然而,最优得分匹配理论表明这些模型应该只能产生记忆的训练样本。为了弥合这一理论与实验的差距,我们识别出两个简单的归纳偏差——局部性和等变性,它们:(1) 通过阻止最优得分匹配来诱导一种组合创造力;(2) 产生完全分析性、完全机制可解释的局部得分(LS)和等变局部得分(ELS)机器,这些机器(3) 在校准单个时间相关超参数后,可以高精度定量预测仅卷积扩散模型(如ResNet和UNet)的输出(在CIFAR10、FashionMNIST、MNIST和CelebA上,我们最佳模型的中位数r2r^2分别为0.95、0.94、0.94、0.96)。我们的模型揭示了一种局部一致的补丁马赛克创造力机制,其中扩散模型通过在不同尺度和图像位置混合和匹配不同的局部训练集补丁,创建指数级数量的新颖图像。我们的理论还部分预测了预训练的自注意力UNet的输出(在CIFAR10上中位数r20.77r^2 \sim 0.77),揭示了注意力在从局部补丁马赛克中雕琢语义连贯性方面的有趣作用。

关键词

引用

@article{arxiv.2412.20292,
  title  = {An analytic theory of creativity in convolutional diffusion models},
  author = {Mason Kamb and Surya Ganguli},
  journal= {arXiv preprint arXiv:2412.20292},
  year   = {2025}
}