基于拖拽的图像编辑中的文本嵌入再思考:DragText
计算机视觉与模式识别
2024-12-05 v2 人工智能
摘要
基于点的图像编辑通过内容拖拽实现精确且灵活的控制。然而,文本嵌入在编辑过程中的作用尚未得到充分调查。一个重要且未被探索的方面是文本与图像嵌入之间的相互作用。在扩散模型的渐进编辑过程中,文本嵌入保持恒定不变。随着图像嵌入逐渐偏离其初始状态,图像与文本嵌入之间的差异成为一个显著挑战。本研究发现,文本提示在维持内容完整性和实现所需操作方面对拖拽过程具有重要影响。基于这些见解,我们提出DragText,通过优化文本嵌入以与拖拽过程协同工作,以与修改后的图像嵌入配对。同时,我们对文本优化过程进行正则化,以保持原始文本提示的完整性。我们的ethods 可以无缝集成到现有的基于扩散的拖拽方法中,通过仅添加几行代码即可提升性能。
引用
@article{arxiv.2407.17843,
title = {DragText: Rethinking Text Embedding in Point-based Image Editing},
author = {Gayoon Choi and Taejin Jeong and Sujung Hong and Seong Jae Hwang},
journal= {arXiv preprint arXiv:2407.17843},
year = {2024}
}
备注
Accepted at WACV 2025; Code is released at https://github.com/MICV-yonsei/DragText