中文

通过基于参考的自适应调制实现免训练多风格融合

计算机视觉与模式识别 2025-09-24 v1

摘要

我们提出了自适应多风格融合(AMSF),这是一种基于参考的免训练框架,能够在扩散模型中实现多个参考风格的可控融合。现有的大多数基于参考的方法受限于:仅接受单张风格图像,从而阻碍了混合美学及向更多风格的扩展;以及缺乏平衡多种风格影响的机制。AMSF 通过语义 token 分解模块编码所有风格图像和文本提示,并将其自适应地注入冻结扩散模型的每个交叉注意力层,从而缓解了这些挑战。随后,相似度感知重加权模块在每个去噪步骤中重新校准分配给每个风格成分的注意力,无需任何微调或外部适配器即可产生平衡且用户可控的融合效果。定性和定量评估均表明,AMSF 生成的多风格融合结果持续优于 SOTA 方法,且其融合设计可无缝扩展至两种或多种风格。这些能力使 AMSF 成为扩散模型中实现富有表现力的多风格生成的实用一步。

关键词

引用

@article{arxiv.2509.18602,
  title  = {Training-Free Multi-Style Fusion Through Reference-Based Adaptive Modulation},
  author = {Xu Liu and Yibo Lu and Xinxian Wang and Xinyu Wu},
  journal= {arXiv preprint arXiv:2509.18602},
  year   = {2025}
}

备注

Accepted at ACPR 2025 (oral)