DirectDrag:基于读出引导的无掩码、无提示拖拽式高保真图像编辑
计算机视觉与模式识别
2025-12-04 v1
摘要
使用生成模型进行基于拖拽的图像编辑提供了对图像结构的直观控制。然而,现有方法依赖于手动提供的掩码和文本提示以保持语义保真度和运动精确度。消除这些约束会导致根本性的权衡:没有掩码会产生视觉伪影,而没有提示则导致空间控制不佳。为此,我们提出DirectDrag,一种新型无掩码、无提示编辑框架。DirectDrag实现了精准、高效的操控,同时保持高图像保真度和准确的点对齐。DirectDrag的两个关键创新点首先,我们设计了自动软掩码生成模块,从点位位移中智能推断可编辑区域,自动在运动路径上定位变形,同时通过生成模型固有的能力保持上下文完整性。其次,我们开发了读出引导的特征对齐机制,利用中间扩散激活值,在基于点的编辑期间保持结构一致性,显著提高视觉保真度。尽管在无需手动掩码或提示的情况下,DirectDrag仍实现了优于现有方法的优异图像质量,同时保持竞争性的拖拽精度。在DragBench和真实场景中的大量实验表明,DirectDrag在实现高质量、交互式图像操控方面有效且实用。项目页面:https://frakw.github.io/DirectDrag/。代码可在 https://github.com/frakw/DirectDrag 获取。
引用
@article{arxiv.2512.03981,
title = {DirectDrag: High-Fidelity, Mask-Free, Prompt-Free Drag-based Image Editing via Readout-Guided Feature Alignment},
author = {Sheng-Hao Liao and Shang-Fu Chen and Tai-Ming Huang and Wen-Huang Cheng and Kai-Lung Hua},
journal= {arXiv preprint arXiv:2512.03981},
year = {2025}
}