中文

通过自适应特征聚合实现扩散模型集成

计算机视觉与模式识别 2025-02-25 v2

摘要

文本引导扩散模型的成功激发了开源社区开发和发布众多强大扩散模型,这些模型通常在各种专家数据集上进行微调,展示出多样化的去噪能力。利用多个高质量模型以产生更强的生成能力具有价值,但实际研究不多。现有方法主要采用参数合并策略以生成新的静态模型。然而,这些方法忽视了模型间去噪能力可能在不同状态下(如不同提示、初始噪声、去噪步骤和空间位置)动态变化的事实。本文提出一种新颖的集成方法,自适应特征聚合(AFA),通过综合考虑各种状态(即提示、初始噪声、去噪步骤和空间位置),动态调整多个模型在特征层面的贡献,从而保留多个扩散模型的优势并抑制其缺点。具体而言,我们设计了一种轻量级空间感知块级(SABW)特征聚合器,通过自适应方式将来自多个 U-Net 去噪器的块级中间特征聚合为统一特征。核心思想在于综合考虑各种状态,为每个模型的特征动态生成各自的注意力图。值得注意的是,只有 SABW 需要训练,参数约为5000万,而其他模型保持冻结状态。定量和定性实验均证明了所提出的自适应特征聚合方法的有效性。

关键词

引用

@article{arxiv.2405.17082,
  title  = {Ensembling Diffusion Models via Adaptive Feature Aggregation},
  author = {Cong Wang and Kuan Tian and Yonghang Guan and Fei Shen and Zhiwei Jiang and Qing Gu and Jun Zhang},
  journal= {arXiv preprint arXiv:2405.17082},
  year   = {2025}
}