中文

HiFi Tuner:面向扩散模型的高保真主体驱动微调方法

计算机视觉与模式识别 2023-12-04 v1 人工智能 计算与语言 机器学习

摘要

本文探讨了利用预训练文本到图像扩散模型在高保真个性化图像生成方面的进展。尽管先前方法在基于文本描述和少量输入图像生成多样化场景上取得显著进展,但在保持生成图像中主体保真度方面仍存在挑战。在本工作中,我们引入一种名为 HiFi Tuner 的创新算法,以增强个性化图像生成过程中物体的外观保持。我们提出的方法采用参数高效微调框架,包含去噪过程和关键反演过程。关键改进包括利用掩码引导、一种新颖的参数正则化技术,以及引入逐步主体表示以提升样本保真度。此外,我们提出一种参考引导生成方法,利用参考图像的关键反演来减轻不期望的主体变化和伪影。我们进一步将方法扩展至一种新颖的图像编辑任务:通过文本操作替换图像中的主体。在 DreamBooth 数据集上使用 Stable Diffusion 模型进行的实验评估展示了有前景的结果。仅微调文本嵌入相较 Textual Inversion 将 CLIP-T 分数提升 3.6 点、DINO 分数提升 9.6 点。当微调所有参数时,HiFi Tuner 相较 DreamBooth 将 CLIP-T 分数提升 1.2 点、DINO 分数提升 1.2 点,确立了新的最优性能。

关键词

引用

@article{arxiv.2312.00079,
  title  = {HiFi Tuner: High-Fidelity Subject-Driven Fine-Tuning for Diffusion Models},
  author = {Zhonghao Wang and Wei Wei and Yang Zhao and Zhisheng Xiao and Mark Hasegawa-Johnson and Humphrey Shi and Tingbo Hou},
  journal= {arXiv preprint arXiv:2312.00079},
  year   = {2023}
}