ContextDrag:基于上下文保留令牌注入和位置对齐注意力的精确拖拽图像编辑
计算机视觉与模式识别
2026-04-07 v2 人工智能
摘要
拖拽式图像编辑通过基于点的拖拽操作实现直观的视觉操作。现有方法主要依赖扩散反转或像素空间配准配合填充,但反转本质上会引入近似误差导致纹理保真度下降,刚性像素空间操作则丢弃语义上下文并产生不自然的变形。为此,我们提出ContextDrag,首个将拖拽式操作引入上下文图像编辑范式的框架。利用编辑模型(如 FLUX-Kontext)的上下文能力,ContextDrag 实现无需反转或微调的精确拖拽编辑。具体而言,我们提出上下文保留令牌注入(CTI),通过潜在空间对应关系从用户指定的控制点估计,注入VAE 编码的参考特征到注意力层的空间对齐目标位置。通过操作干净的直接编码特征而非噪声的反转输出,CTI 保留丰富的纹理细节并实现精确的拖拽控制。其次,我们提出位置对齐注意力(PAA),以消除参考特征空间位移造成的干扰。PAA 重新编码位移参考标记的位置嵌入以匹配其目标位置,并掩码源位置与目标位置之间的重叠区域,以防止冲突特征降低视觉一致性。在 DragBench-SR 和 DragBench-DR 上的实验表明,ContextDrag 实现了 SOTA 编辑精度和整体质量,综合性消失实验验证了每个提议组件的有效性。代码将公开 release。
引用
@article{arxiv.2512.08477,
title = {ContextDrag: Precise Drag-Based Image Editing via Context-Preserving Token Injection and Position-Aligned Attention},
author = {Huiguo He and Pengyu Yan and Ziqi Yi and Weizhi Zhong and Zheng Liu and Yejun Tang and Huan Yang and Guanbin Li and Lianwen Jin},
journal= {arXiv preprint arXiv:2512.08477},
year = {2026}
}