Stencil:基于上下文引导的主体驱动生成
计算机视觉与模式识别
2025-09-23 v1
摘要
最近的文本到图像扩散模型能够生成惊人视觉效果,但往往无法在不同生成之间保持主体一致性。当前微调方法的一个主要局限是质量与效率之间的内在权衡。大模型的微调可以提高保真度,但计算成本高昂;轻量模型的微调可以提高效率,但会牺牲图像保真度。此外,对预训练模型进行小样本主体图像微调可能会损坏现有先验,导致次优结果。为此,我们提出了Stencil,一种在推理期间同时运用两个扩散模型的新型框架。Stencil有效地对主体图像进行轻量模型的微调,同时一个大型冻结预训练模型在推理期间提供上下文引导,将丰富的先验注入以最小的开销增强生成。Stencil在生成主体的高保真、新颖呈现方面表现出色,仅需不到一分钟即可实现最先进的性能,在主体驱动生成方面树立了新的基准。
引用
@article{arxiv.2509.17120,
title = {Stencil: Subject-Driven Generation with Context Guidance},
author = {Gordon Chen and Ziqi Huang and Cheston Tan and Ziwei Liu},
journal= {arXiv preprint arXiv:2509.17120},
year = {2025}
}
备注
Accepted as Spotlight at ICIP 2025