UniCSG:基于分阶段语义与频率解�合的统一高保真内容约束风格驱动生成框架
计算机视觉与模式识别
2026-04-21 v1
摘要
风格迁移必须在保持内容语义的同时匹配目标风格。基于 DiT 的扩散模型常因内容-风格纠缠导致参考内容泄漏和生成不稳定。我们提出 UniCSG,一个用于文本驱动和参考驱动设置下的 content-constrained, style-driven generation 的统一框架。UniCSG 采用分阶段训练:(i) 采用低频预处理结合条件噪声,以鼓励内容-风格分离的潜在空间语义解�合阶段;(ii) 采用多尺度频率监督对潜在空间频率感知细节重建阶段进行细化。我们进一步引入像素空间奖励学习,以对齐解码后的感知质量目标。实验表明,在两种设置下,UniCSG 在内容忠实性、风格对齐和鲁棒性方面均取得改进。
引用
@article{arxiv.2604.17850,
title = {UniCSG: Unified High-Fidelity Content-Constrained Style-Driven Generation via Staged Semantic and Frequency Disentanglement},
author = {Jingwei Yang and Ruoxi Wu and Wei Shen and Meng Li and Yulong Liu and Huimin She and Lunxi Yuan},
journal= {arXiv preprint arXiv:2604.17850},
year = {2026}
}