中文

UniCSG:基于分阶段语义与频率解�合的统一高保真内容约束风格驱动生成框架

计算机视觉与模式识别 2026-04-21 v1

摘要

风格迁移必须在保持内容语义的同时匹配目标风格。基于 DiT 的扩散模型常因内容-风格纠缠导致参考内容泄漏和生成不稳定。我们提出 UniCSG,一个用于文本驱动和参考驱动设置下的 content-constrained, style-driven generation 的统一框架。UniCSG 采用分阶段训练:(i) 采用低频预处理结合条件噪声,以鼓励内容-风格分离的潜在空间语义解�合阶段;(ii) 采用多尺度频率监督对潜在空间频率感知细节重建阶段进行细化。我们进一步引入像素空间奖励学习,以对齐解码后的感知质量目标。实验表明,在两种设置下,UniCSG 在内容忠实性、风格对齐和鲁棒性方面均取得改进。

关键词

引用

@article{arxiv.2604.17850,
  title  = {UniCSG: Unified High-Fidelity Content-Constrained Style-Driven Generation via Staged Semantic and Frequency Disentanglement},
  author = {Jingwei Yang and Ruoxi Wu and Wei Shen and Meng Li and Yulong Liu and Huimin She and Lunxi Yuan},
  journal= {arXiv preprint arXiv:2604.17850},
  year   = {2026}
}