中文

面向主体驱动生成的视觉自回归模型精细调优

计算机视觉与模式识别 2025-07-31 v2

摘要

最近的文本到图像生成模型的进展使众多实际应用成为可能,包括主体驱动生成,该方法通过仅从少量示例捕获主体语义进行预训练模型的微调。虽然扩散模型产生高质量图像,但其大量去噪步骤导致显著的计算开销,限制了实际应用。视觉自回归(VAR)模型通过预测下一个尺度的标记而非空间相邻标记,提供了适用于实际部署的显著更快的推理。本文提出首个基于 VAR 的主体驱动生成方法。然而,naive 微调 VAR 会导致计算开销、语言漂移和多样性下降。为解决这些挑战,我们引入选择性层调优以降低复杂度,并通过先验蒸馏来缓解语言漂移。此外,我们发现早期阶段对主体生成的影响大于后期阶段,后者仅合成细微细节。基于此发现,我们提出尺度加权调优,优先处理较粗糙分辨率,以促进模型专注于主体相关信息而非局部细节。广泛的实验验证表明,我们的方法在各种指标上均显著优于基于扩散的基线,并展示了其实际用途。

关键词

引用

@article{arxiv.2504.02612,
  title  = {Fine-Tuning Visual Autoregressive Models for Subject-Driven Generation},
  author = {Jiwoo Chung and Sangeek Hyun and Hyunjun Kim and Eunseo Koh and MinKyu Lee and Jae-Pil Heo},
  journal= {arXiv preprint arXiv:2504.02612},
  year   = {2025}
}

备注

Accepted to ICCV 2025. Project page: https://jiwoogit.github.io/ARBooth/