中文

通过超网络实现无需微调的文本到图像生成个性化

计算机视觉与模式识别 2025-11-06 v1

摘要

文本到图像扩散模型的主流个性化方法是基于主体特定的微调方法,如 DreamBooth~\cite{ruiz2023dreambooth},但计算成本高昂且推理速度慢。近期的适配器和编码器基于方法试图降低开销,但仍依赖于额外的微调或大型主干模型以获得满意的结果。本文我们重新审视一种正交方向:通过超网络实现无需微调的个性化,超网络直接从主体图像预测 LoRA 适配权重。先前的超网络方法然而会面临高成本的数据生成或不稳定的尝试模仿基模型优化轨迹的问题。我们通过一种端到端训练目标并以简单输出正则化手段加以稳定,实现可靠且高效的超网络。该方法在测试时无需针对每个主体进行优化,同时保持主体忠实度和提示对齐。为进一步提升推理时的组合性泛化能力,我们引入混合模型分类器自由指导 (HM-CFG),在采样过程中将基扩散模型的组合优势与个性化模型的主体忠实度相结合。广泛的实验在 CelebA-HQ、AFHQ-v2 和 DreamBench 上表明,我们的方法在个性化性能方面取得优异成绩,并凸显了超网络作为开放类别个性化可扩展且高效方向的潜力。

关键词

引用

@article{arxiv.2511.03156,
  title  = {Finetuning-Free Personalization of Text to Image Generation via Hypernetworks},
  author = {Sagar Shrestha and Gopal Sharma and Luowei Zhou and Suren Kumar},
  journal= {arXiv preprint arXiv:2511.03156},
  year   = {2025}
}