中文

通过扩散噪声提高联合嵌入预测架构的性能

计算机视觉与模式识别 2025-07-22 v1

摘要

自监督学习已成为特征学习方面极其成功的方法,广泛应用于许多下游任务。它尤其对判别性任务效果卓越,超越了流行的生成模型。然而,生成模型在图像生成和细节增强方面表现更好。因此,我们自然地寻找将SSL与生成模型联系起来以进一步增强SSL表示能力的方法。由于生成模型可以通过近似数据分布来创建新的样本,这种建模也应导致对原始视觉数据的语义理解,这是识别任务所必需的。这启发我们将核心原理——扩散噪声——与SSL结合以学习竞争性识别模型。具体而言,扩散噪声可视为一种特定的掩码状态,从而揭示了掩码图像建模(MIM)与扩散模型之间的密切关系。本文提出N-JEPA(基于噪声的JEPA),将扩散噪声整合到MIM中,通过被遮盖token的位置嵌入来实现。多级噪声计划是一系列特征增强,用于进一步增强模型的鲁棒性。我们进行了全面研究以确认其在下游任务分类中的有效性。代码将很快在公开渠道发布。

关键词

引用

@article{arxiv.2507.15216,
  title  = {Improving Joint Embedding Predictive Architecture with Diffusion Noise},
  author = {Yuping Qiu and Rui Zhu and Ying-cong Chen},
  journal= {arXiv preprint arXiv:2507.15216},
  year   = {2025}
}