中文

Repulsor: 通过对比记忆库加速生成建模

计算机视觉与模式识别 2025-12-16 v2

摘要

去噪生成模型(如扩散模型、流匹配)在视觉合成中的主导地位受到其高昂训练成本和表示学习效率低下的制约。虽然通过辅助对齐注入判别性表示已被证明有效,但该方法仍面临关键局限:对外部预训练编码器的依赖引入了额外开销和域偏移。一种基于分散化的策略鼓励批次内潜在表示之间的强分离,从而缓解了这一特定依赖。为评估负样本数量在生成建模中的影响,我们提出 {\mname},一种无需外部编码器的即插即用训练框架。我们的方法集成了一个记忆库机制,在训练迭代中维护一个大规模、动态更新的负样本队列。这将负样本数量与小批量大小解耦,为对比目标提供了充足且高质量的负样本,而不会带来计算成本的乘数增长。采用低维投影头进一步最小化内存和带宽开销。{\mname} 具有三个主要优势:(1) 它是自包含的,消除了对预训练视觉基础模型及其相关前向传播开销的依赖;(2) 在推理过程中不引入额外参数或计算成本;(3) 它实现了显著更快的收敛,以更高效率达到优越的生成质量。在 ImageNet-256 上,{\mname} 在 400k 步内实现了 2.40 的最先进 FID,显著优于可比方法。

关键词

引用

@article{arxiv.2512.08648,
  title  = {Repulsor: Accelerating Generative Modeling with a Contrastive Memory Bank},
  author = {Shaofeng Zhang and Xuanqi Chen and Ning Liao and Haoxiang Zhao and Xiaoxing Wang and Haoru Tan and Sitong Wu and Xiaosong Jia and Qi Fan and Junchi Yan},
  journal= {arXiv preprint arXiv:2512.08648},
  year   = {2025}
}

备注

19 pages, 19 figures