中文

当少量步骤足矣:保持身份生成的免训练加速

计算机视觉与模式识别 2026-05-12 v1 人工智能

摘要

保持身份的图像生成通常建立在多步扩散骨干网络之上,这使得个性化生成在部署时成本高昂。我们表明,对于以身份为条件的 FLUX 生成,这种成本通常是不必要的。一个用 dev 训练的冻结 InfuseNet 身份适配器可以直接迁移到蒸馏的 schnell 骨干网络,而无需重新训练。这种两行代码的替换——更改骨干网络路径并禁用无分类器引导——将延迟降低了 5.9 倍,同时与标准的 28 步 dev 基线相比,ArcFace 身份相似度提高了 +0.028,lpips 降低了 -0.016。为了解释其有效原因,我们分析了去噪轨迹,发现身份保真度进入了一个早期有效阶段(通常在 4-8 步内),而后续步骤主要精炼视觉细节、锐度和对比度。适配器消融实验证实身份形成依赖于身份适配器,而注意力流范数探测表明,随着采样的进行,相对条件贡献会下降。在 SDXL 和 SD1.5 上的初步风格适配器和物体适配器扫描显示,在中间步骤之后存在类似的收益递减。这些结果将蒸馏骨干网络替换定位为一种简单、免训练的策略,用于改善保持身份生成的效率-保真度权衡。

关键词

引用

@article{arxiv.2605.09460,
  title  = {When Few Steps Are Enough: Training-Free Acceleration of Identity-Preserved Generation},
  author = {Dongqi Zheng},
  journal= {arXiv preprint arXiv:2605.09460},
  year   = {2026}
}