中文

InstantDrag:提升基于拖拽的图像编辑的交互性

计算机视觉与模式识别 2024-12-03 v2

摘要

基于拖拽的图像编辑因其交互性和精确性而近来受到欢迎。然而,尽管文本到图像模型能够在一秒内生成样本,但由于在保持图像内容的同时准确反映用户交互的挑战,拖拽编辑仍然滞后。一些现有方法依赖于计算密集型的逐图像优化或复杂的基于引导的方法,需要额外的输入,如可移动区域的掩码和文本提示,从而损害了编辑过程的交互性。我们引入了 InstantDrag,这是一种无需优化的流程,增强了交互性和速度,仅需一张图像和一个拖拽指令作为输入。InstantDrag 由两个精心设计的网络组成:一个以拖拽为条件的光流生成器 (FlowGen) 和一个以光流为条件的扩散模型 (FlowDiffusion)。InstantDrag 通过将任务分解为运动生成和以运动为条件的图像生成,在真实世界视频数据集中学习基于拖拽的图像编辑的运动动力学。我们通过在面部视频数据集和通用场景上的实验,展示了 InstantDrag 在没有掩码或文本提示的情况下执行快速、照片级真实编辑的能力。这些结果凸显了我们方法在处理基于拖拽的图像编辑方面的效率,使其成为交互式实时应用的一个有前景的解决方案。

关键词

引用

@article{arxiv.2409.08857,
  title  = {InstantDrag: Improving Interactivity in Drag-based Image Editing},
  author = {Joonghyuk Shin and Daehyeon Choi and Jaesik Park},
  journal= {arXiv preprint arXiv:2409.08857},
  year   = {2024}
}

备注

SIGGRAPH Asia 2024. Project webpage: https://joonghyuk.com/instantdrag-web/