DragLoRA:用于扩散模型中基于 Drag 的图像编辑的在线 LoRA 适配器优化
计算机视觉与模式识别
2025-05-21 v2
摘要
基于预训练扩散模型的拖拽式编辑提供了精确且灵活的方式来操控前景对象。传统方法直接优化 DDIM 反向中的输入特征,通过迭代调整来引导控制点前往目标位置。然而,这些方法常因特征在运动监督下的表示能力有限,以及点追踪所需的大搜索空间导致精度受限和效率低下。为此,我们提出了 DragLoRA,一个将 LoRA(低秩适配)适配器集成到拖拽式编辑管道中的新型框架。为增强 LoRA 适配器的训练,我们引入额外的去噪得分蒸馏损失,以正则化在线模型,使其输出与原始模型一致。此外,我们通过使用更新后的 LoRA 调整输入特征,提高了运动监督的一致性,为后续操作提供更稳定准确的输入特征。基于此,我们设计了自适应优化方案,动态在两种模式之间切换,在不牺牲精度的前提下优先提高效率。广泛的实验表明,DragLoRA显著提高了拖拽式图像编辑的控制精度和计算效率。DragLoRA 的代码已公开:https://github.com/Sylvie-X/DragLoRA。
引用
@article{arxiv.2505.12427,
title = {DragLoRA: Online Optimization of LoRA Adapters for Drag-based Image Editing in Diffusion Model},
author = {Siwei Xia and Li Sun and Tiantian Sun and Qingli Li},
journal= {arXiv preprint arXiv:2505.12427},
year = {2025}
}
备注
Accepted by ICML2025