SplitFlux:从单张图像中学习解耦内容与风格
计算机视觉与模式识别
2025-12-01 v2
摘要
解耦图像内容与风格对于定制化图像生成至关重要。现有的基于SDXL的方法在实现高质量结果方面存在挑战,而最近提出的Flux模型由于未充分探索其特性,未能实现有效的内容-风格分离。为此,我们对Flux进行系统性分析,提出了两个关键观察:(1) 单流模块对于图像生成至关重要;(2) 早期单流模块主要控制内容,而后期模块则支配风格。基于这些洞见,我们提出了SplitFlux,通过对单流模块进行LoRA微调来实现内容与风格的解耦,从而将解耦后的内容重新嵌入到新情境中。它包含两个关键组件:(1) 秩受限适应。为保留内容的身份识别与结构,我们压缩特定模块中更新的秩并放大其幅度,从而防止内容泄漏到风格模块中。(2) 基于视觉门控的LoRA。我们将内容LoRA分为两个分支,采用不同的秩,并依据图像显著性进行指导。高秩分支保留主要主体信息,而低秩分支编码残余细节,从而缓解内容过拟合并实现无缝重嵌入。大量实验表明,SplitFlux在各种场景下均显著优于当前最先进的方法,在内容保留和风格化质量方面实现卓越表现。
引用
@article{arxiv.2511.15258,
title = {SplitFlux: Learning to Decouple Content and Style from a Single Image},
author = {Yitong Yang and Yinglin Wang and Changshuo Wang and Yongjun Zhang and Ziyang Chen and Shuting He},
journal= {arXiv preprint arXiv:2511.15258},
year = {2025}
}