中文

USO:通过解耦与奖励学习实现统一的风格与主体驱动生成

计算机视觉与模式识别 2025-08-27 v1 机器学习

摘要

现有文献通常将风格驱动生成和主体驱动生成视为两个不相干的任务:前者优先考虑风格相似性,而后者坚持主体一致性,导致明显的对立。我们认为,这两个目标可以在一个统一的框架下实现,因为它们最终都涉及内容和风格的解耦与重组,这是风格驱动研究中一个长期存在的主题。为此,我们提出了USO,一个统一的风格-主体优化定制模型。首先,我们构建了一个大规模三元组数据集,包含内容图像、风格图像及其对应的风格化内容图像。其次,我们引入了一种解耦学习方案,通过两个互补的目标——风格对齐训练和内容-风格解耦训练——同时对齐风格特征并将内容与风格解耦。第三,我们引入了一种称为SRL的风格奖励学习范式,以进一步提升模型性能。最后,我们发布了USO-Bench,这是第一个跨多个指标联合评估风格相似性和主体保真度的基准。大量实验表明,USO在主体一致性和风格相似性两个维度上,均在开源模型中达到了最先进的性能。代码和模型:https://github.com/bytedance/USO

关键词

引用

@article{arxiv.2508.18966,
  title  = {USO: Unified Style and Subject-Driven Generation via Disentangled and Reward Learning},
  author = {Shaojin Wu and Mengqi Huang and Yufeng Cheng and Wenxu Wu and Jiahe Tian and Yiming Luo and Fei Ding and Qian He},
  journal= {arXiv preprint arXiv:2508.18966},
  year   = {2025}
}

备注

Project page: https://bytedance.github.io/USO/ Code and model: https://github.com/bytedance/USO