无条件CNN去噪器包含图像的稀疏语义表示
计算机视觉与模式识别
2025-10-16 v2
摘要
生成扩散模型通过训练神经网络去除噪声以估计分数,从而学习多样图像数据集上的概率密度。尽管其在生成高质量图像方面取得了显著成功,但底层分数网络的内部机制尚不清楚。在此,我们研究了在{全卷积无条件UNet}中通过分数估计产生的图像表示。我们表明,UNet的中间块将单张图像分解为活跃通道的稀疏子集,并且这些通道空间平均值构成的向量可以提供底层干净图像的非线性表示。该表示空间中的欧氏距离具有语义意义,尽管在训练期间未提供任何条件信息。我们开发了一种基于该表示条件的图像随机重建新算法:使用无条件模型的合成由从该模型本身提取的表示“自引导”。对于给定表示,重建样本集合中的共同模式揭示了UNet中间块捕获的特征。这些结果首次表明,语义相似性的度量仅从去噪目标中无监督地产生。
引用
@article{arxiv.2506.01912,
title = {Unconditional CNN denoisers contain sparse semantic representation of images},
author = {Zahra Kadkhodaie and Stéphane Mallat and Eero Simoncelli},
journal= {arXiv preprint arXiv:2506.01912},
year = {2025}
}