中文

LazyDrag: 基于显式对应实现多模态扩散Transformer上的稳定拖拽编辑

计算机视觉与模式识别 2026-02-04 v3

摘要

依赖通过注意力进行的隐式点匹配已成为拖拽编辑的核心瓶颈,导致在反转强度减弱与高昂的测试时优化之间做出根本妥协。这种妥协严重限制了扩散模型的生成能力,抑制了高保真图像修复与文本引导创作。在本文中,我们提出LazyDrag,这是首个用于多模态扩散Transformer的拖拽图像编辑方法,直接消除了对隐式点匹配的依赖。具体而言,我们的方法根据用户拖拽输入生成显式对应图,作为可靠参考以增强注意力控制。该可靠参考为稳定的全强度反转过程开启了可能,这在拖拽编辑任务中尚属首次。它避免了TTO的必要性并解锁了模型的生成能力。因此,LazyDrag自然地将精确的几何控制与文本引导统一起来,实现了以往无法实现的复杂编辑:张开狗的嘴并修复其内部,生成如“网球”等新物体,或对于模糊拖拽,执行如将手移入口袋等上下文感知更改。此外,LazyDrag支持同时进行移动与缩放操作的多轮工作流。在DragBench上的评估表明,我们的方法在拖拽准确率与感知质量上均优于基线,这一点通过VIEScore与人类评估得到了验证。LazyDrag不仅确立了新的SOTA性能,还为编辑范式开辟了新途径。

关键词

引用

@article{arxiv.2509.12203,
  title  = {LazyDrag: Enabling Stable Drag-Based Editing on Multi-Modal Diffusion Transformers via Explicit Correspondence},
  author = {Zixin Yin and Xili Dai and Duomin Wang and Xianfang Zeng and Lionel M. Ni and Gang Yu and Heung-Yeung Shum},
  journal= {arXiv preprint arXiv:2509.12203},
  year   = {2026}
}

备注

https://zxyin.github.io/LazyDrag