中文

定时式风格注入:拓展训练无关扩散风格迁移中的风格-内容 Pareto 前沿

计算机视觉与模式识别 2026-05-27 v1

摘要

使用预训练扩散模型进行风格迁移已取得快速进展,但核心问题仍未得到充分探讨:风格注入应在模型的何处最强?StyleID 作为领先的训练无关方法,仅使用单个全局参数(gamma)在所有层和时间步上均匀注入风格,这导致风格质量与内容保留之间存在固定的权衡。我们证明了这种权衡并非必然僵化。我们系统性地探索了四个控制维度:在解码器不同层、不同去噪时间步上的风格注入强度,以及在两个轴上对 ControlNet 几何条件进行调度。处处都遵循相同的模式:减弱的调度方案——即在较浅层和较早时间步注入更强的结构信号——可靠地优于相反的做法。除了方向之外,调度形状也至关重要:余弦和平方根时间步调度优于线性调度。最重要的是,我们发现 gamma 调度和 ControlNet 条件几乎是独立的。 resulting 的组合配置拓展了 Pareto 前沿,在风格保真度与内容保留之间提供了优于任何单个基线设置的更佳权衡。我们的最佳平衡配置实现的 ArtFID 为 27.036,相较于 StyleID 的 28.801,提高了 6.1%,在整个风格-内容权衡前沿上均保持一致的提升。结果通过 35 套配置(总计超过 28,000 张风格化图像)使用四个互补指标进行验证。这些发现在 SD 主干模型中具有相同排序的推广性。所有修改均为训练无关、参数无关,仅需几行调度代码即可实现;代码已发布于 https://github.com/ameyskulkarni/scheduled_style_injection。

关键词

引用

@article{arxiv.2605.26538,
  title  = {Scheduled Style Injection: Expanding the Style-Content Pareto Frontier in Training-Free Diffusion-based Style Transfer},
  author = {Amey Sunil Kulkarni},
  journal= {arXiv preprint arXiv:2605.26538},
  year   = {2026}
}

备注

Accepted to CVPR NTIRE 2026