中文

TriLoRA:集成奇异值分解用于文本到图像生成中的高级风格个性化

计算机视觉与模式识别 2024-06-14 v2

摘要

随着深度学习技术的不断进步,图像生成模型,特别是像 Stable Diffusion 这样的模型,正在在视觉艺术创作中找到越来越广泛的应用。然而,这些模型常常面临过拟合、生成结果缺乏稳定性以及在微调过程中难以准确捕获创作者所需特征的挑战。为应对这些挑战,我们提出了一种创新方法,将奇异值分解(SVD)集成到低秩适应(LoRA)参数更新策略中,以增强图像生成模型的微调效率和输出质量。通过在 LoRA 框架中集成 SVD,我们的方法不仅有效降低了过拟合风险,还增强了模型输出的稳定性,更准确地捕获细微的创作者所需特征调整。我们在多个数据集上评估了该方法,结果表明,与传统微调方法相比,我们的方法显著提高了模型的泛化能力和创作灵活性,同时保持了生成质量。此外,该方法保持了 LoRA 在资源受限条件下的卓越性能,在不牺牲原始效率和资源优势的前提下,显著提升了图像生成质量。

关键词

引用

@article{arxiv.2405.11236,
  title  = {TriLoRA: Integrating SVD for Advanced Style Personalization in Text-to-Image Generation},
  author = {Chengcheng Feng and Mu He and Qiuyu Tian and Haojie Yin and Xiaofang Zhao and Hongwei Tang and Xingqiang Wei},
  journal= {arXiv preprint arXiv:2405.11236},
  year   = {2024}
}