中文

LightningDrag:源自视频的闪电般快速且准确的基于拖拽的图像编辑

计算机视觉与模式识别 2024-09-17 v2

摘要

准确性和速度在图像编辑任务中至关重要。Pan等人引入了一个基于拖拽的图像编辑框架,使用生成对抗网络(GAN)实现像素级控制。随后的大量研究通过利用大规模扩散模型增强了该框架的通用性。然而,这些方法通常遭受过长的处理时间(每次编辑超过1分钟)和低成功率。直面这些问题,我们提出了LightningDrag,一种快速方法,可在约1秒内实现高质量的基于拖拽的图像编辑。与大多数先前方法不同,我们将基于拖拽的编辑重新定义为条件生成任务,消除了推理过程中耗时的潜在优化或基于梯度的指导。此外,我们流水线的设计允许我们在大规模配对视频帧上训练模型,这些视频帧包含丰富的运动信息,如物体平移、姿态和方向变化、缩放等。通过从视频中学习,我们的方法在准确性和一致性上显著优于先前方法。尽管仅在视频上训练,我们的模型能很好地泛化到训练数据中未出现的局部形状变形(例如,头发延长、彩虹扭曲等)。在基准数据集上的大量定性和定量评估证实了我们方法的优越性。代码和模型将在https://github.com/magic-research/LightningDrag发布。

关键词

引用

@article{arxiv.2405.13722,
  title  = {LightningDrag: Lightning Fast and Accurate Drag-based Image Editing Emerging from Videos},
  author = {Yujun Shi and Jun Hao Liew and Hanshu Yan and Vincent Y. F. Tan and Jiashi Feng},
  journal= {arXiv preprint arXiv:2405.13722},
  year   = {2024}
}

备注

Project page: https://lightning-drag.github.io/