RegionDrag:基于区域的快速区域图像编辑方法
计算机视觉与模式识别
2024-07-26 v1
摘要
点拖拽式图像编辑方法(如 DragDiffusion)引起了广泛关注。然而,点拖拽方法因基于点的编辑指令稀疏,导致计算开销大且误解用户意图。本文提出了一种区域基 copy-and-paste 拖拽方法 RegionDrag,以克服这些限制。RegionDrag 允许用户以句柄区域和目标区域的形式表达编辑指令,从而实现更精确的控制并缓解歧义。此外,区域基的操作在一次迭代中完成编辑,速度远快于点拖拽方法。我们还采用注意力置换技术以增强编辑期间的稳定性。为验证我们的方法,我们将现有的点拖拽数据集扩展为包含区域拖拽指令。实验结果表明,RegionDrag 在速度、准确性和与用户意图的对齐方面均优于现有的点拖拽方法。值得注意的是,RegionDrag 能在分辨率为512x512 的图像上完成编辑,耗时不足2 秒,这比 DragDiffusion 慢超过100倍,同时实现了更好的性能。项目页面:https://visual-ai.github.io/regiondrag。
引用
@article{arxiv.2407.18247,
title = {RegionDrag: Fast Region-Based Image Editing with Diffusion Models},
author = {Jingyi Lu and Xinghui Li and Kai Han},
journal= {arXiv preprint arXiv:2407.18247},
year = {2024}
}
备注
ECCV 2024, Project page: https://visual-ai.github.io/regiondrag