中文

FastEdit:基于语义感知扩散微调的快速文本引导单图编辑

计算机视觉与模式识别 2024-08-08 v1

摘要

传统的文本引导单图编辑方法需要两步过程,包括对目标文本嵌入进行超过1K次迭代微调,以及对生成模型进行另外1.5K次迭代微调。尽管这确保了生成图像与输入图像和目标文本紧密对齐,但该过程通常每张图像需要7分钟,由于其耗时性,对实际应用构成挑战。为了解决这一瓶颈,我们提出了FastEdit,一种具有语义感知扩散微调的快速文本引导单图编辑方法,将编辑过程大幅加速至仅需17秒。FastEdit简化了生成模型的微调阶段,将其从1.5K次减少到仅50次迭代。对于扩散微调,我们根据输入图像与目标文本之间的语义差异采用特定的时间步长值。此外,FastEdit通过利用基于特征空间而非文本嵌入空间的图生图模型来规避初始微调步骤。它可以在同一特征空间内有效对齐目标文本提示和输入图像,并节省大量处理时间。此外,我们将参数高效微调技术LoRA应用于U-net。通过LoRA,FastEdit将模型的可训练参数最小化至原始大小的仅0.37\%。同时,我们可以在显著降低计算开销的情况下实现可比的编辑效果。我们进行了广泛实验来验证方法的编辑性能,并展示了有前景的编辑能力,包括内容添加、风格迁移、背景替换和姿态操控等。

关键词

引用

@article{arxiv.2408.03355,
  title  = {FastEdit: Fast Text-Guided Single-Image Editing via Semantic-Aware Diffusion Fine-Tuning},
  author = {Zhi Chen and Zecheng Zhao and Yadan Luo and Zi Huang},
  journal= {arXiv preprint arXiv:2408.03355},
  year   = {2024}
}

备注

Technical Report