增强基于 Stable Diffusion 的模型创意生成能力
计算机视觉与模式识别
2025-04-01 v1
摘要
近期文本到图像生成模型,尤其是 Stable Diffusion 及其蒸馏变体,已实现卓越的保真度和强大的文本-图像对齐。然而,其创意能力仍受限,因为将“creative”纳入提示词往往难以获得预期结果。本文引入 C3(Creative Concept Catalyst),一种旨在增强 Stable Diffusion 类模型创意能力的训练自由方法。C3 在去噪过程中选择性放大特征,以培育更具创造性的输出。我们提供了基于创意两个主要方面的挑放大因子的实用指南。C3 是首个在不进行大量计算成本的情况下提升扩散模型创意能力的研究。我们在 various Stable Diffusion 类模型上Demonstrate了其有效性。
引用
@article{arxiv.2503.23538,
title = {Enhancing Creative Generation on Stable Diffusion-based Models},
author = {Jiyeon Han and Dahee Kwon and Gayoung Lee and Junho Kim and Jaesik Choi},
journal= {arXiv preprint arXiv:2503.23538},
year = {2025}
}
备注
CVPR 2025 accepted paper