中文

Stencil:基于上下文引导的主体驱动生成

计算机视觉与模式识别 2025-09-23 v1

摘要

最近的文本到图像扩散模型能够生成惊人视觉效果,但往往无法在不同生成之间保持主体一致性。当前微调方法的一个主要局限是质量与效率之间的内在权衡。大模型的微调可以提高保真度,但计算成本高昂;轻量模型的微调可以提高效率,但会牺牲图像保真度。此外,对预训练模型进行小样本主体图像微调可能会损坏现有先验,导致次优结果。为此,我们提出了Stencil,一种在推理期间同时运用两个扩散模型的新型框架。Stencil有效地对主体图像进行轻量模型的微调,同时一个大型冻结预训练模型在推理期间提供上下文引导,将丰富的先验注入以最小的开销增强生成。Stencil在生成主体的高保真、新颖呈现方面表现出色,仅需不到一分钟即可实现最先进的性能,在主体驱动生成方面树立了新的基准。

关键词

引用

@article{arxiv.2509.17120,
  title  = {Stencil: Subject-Driven Generation with Context Guidance},
  author = {Gordon Chen and Ziqi Huang and Cheston Tan and Ziwei Liu},
  journal= {arXiv preprint arXiv:2509.17120},
  year   = {2025}
}

备注

Accepted as Spotlight at ICIP 2025