面向文本到图像扩散模型的语义锚定:实现稳健的个人化
计算机视觉与模式识别
2025-12-01 v1
摘要
文本到图像扩散模型在生成多样且逼真的图像方面取得了显著进展,但仍在个人化方面存在挑战——这需要仅凭少量参考图像便能适应用户特定主体的预训练模型。关键挑战在于:仅从有限的参考图像中学习新视觉概念,同时保持预训练语义先验,以维持文本-图像对齐。当模型聚焦于主体保真度时,倾向于过拟合有限的参考图像,无法利用预训练分布。相反,强调先验保持可维持语义一致性,但会阻碍模型学习新的个人化属性。基于这些观察,我们提出了通过语义锚定实现个人化的过程,该过程通过以其相应分布为依托来指导新概念的适应。因此,我们将个人化重新表述为:通过语义锚定 guided by 其频繁对应物来学习稀有概念的过程。这种锚定鼓励模型以稳定且受控的方式适应新概念,将预训练分布向个人化区域扩展,同时保持其语义结构。结果是,所提方法在主体保真度和文本-图像对齐方面实现稳定适应和持续性改进。广泛的实验和消融研究进一步证明了所提锚定策略的鲁棒性和有效性。
引用
@article{arxiv.2511.22245,
title = {Semantic Anchoring for Robust Personalization in Text-to-Image Diffusion Models},
author = {Seoyun Yang and Gihoon Kim and Taesup Kim},
journal= {arXiv preprint arXiv:2511.22245},
year = {2025}
}