注意力机制扩散模型中的创造性起源
机器学习
2025-09-30 v2 计算机视觉与模式识别
摘要
随着扩散模型成为图像生成的首选工具且图像质量持续提升,探讨“创造性”在扩散模型中的起源日益重要。基于得分匹配视角的扩散模型理论为理解扩散模型为何生成符合图像学且与训练图像有显著差异的图像提供了具备解释性的框架。特别是,如 Kamb 与 Ganguli(2024)及其他研究者(如 Ambrogioni,2023)所述,若我们的得分匹配最为理想,我们只能通过扩散过程恢复训练样本。然而,Kamb 与 Ganguli(2024)指出,在得分由简单卷积神经网络(CNN)参数化的扩散模型中,CNN 本身的归纳偏置(平移等变性和局部性)允许模型生成在全局上不匹配任何训练样本但在局部上呈“马赛克”样子的样本。值得注意的是,这一理论尚未说明注意力机制在此过程中的作用。本文作出初步探索性工作,通过将该理论推广至得分由带最终注意力层的 CNN 参数化的扩散模型,来填补这一空白。我们表明,理论表明注意力会在生成样本中超越 patch 级别,实现局部特征的全局图像一致性排列,我们在精心构建的数据集上对这一行为进行了实证验证。
引用
@article{arxiv.2506.17324,
title = {Origins of Creativity in Attention-Based Diffusion Models},
author = {Emma Finn and T. Anderson Keller and Manos Theodosis and Demba E. Ba},
journal= {arXiv preprint arXiv:2506.17324},
year = {2025}
}