基于区域感知视觉语言模型的FireEdit:细粒度指令式图像编辑
计算机视觉与模式识别
2025-04-01 v2
摘要
当前,指令式图像编辑方法通过利用视觉语言模型(VLM)的强大跨模态理解能力取得了显著进展。然而,这些方法仍面临三个关键挑战:1)复杂场景;2)语义一致性;3)细粒度编辑。为此,我们提出了FireEdit——一种创新的细粒度指令式图像编辑框架,利用区域感知VLM。FireEdit旨在准确理解用户指令并确保有效控制编辑过程。具体而言,我们通过引入额外的区域标记来增强VLM的细粒度视觉感知能力。仅依赖LLM输出来指导扩散模型可能导致次优编辑结果。因此,我们提出了时间感知目标注入模块和混合视觉交叉注意力模块。前者通过整合时间步长嵌入与文本嵌入,动态调整各去噪阶段的引导强度;后者增强图像编辑的视觉细节,从而保持编辑结果与源图像之间的语义一致性。通过将区域感知VLM增强后的VLM与时序依赖的扩散模型相结合,FireEdit在理解编辑指令和保持高语义一致性方面显示出显著优势。大量实验表明,我们的方法在指令式图像编辑方面优于现有最先进的方法。我们的项目已在https://zjgans.github.io/fireedit.github.io上线。
引用
@article{arxiv.2503.19839,
title = {FireEdit: Fine-grained Instruction-based Image Editing via Region-aware Vision Language Model},
author = {Jun Zhou and Jiahao Li and Zunnan Xu and Hanhui Li and Yiji Cheng and Fa-Ting Hong and Qin Lin and Qinglin Lu and Xiaodan Liang},
journal= {arXiv preprint arXiv:2503.19839},
year = {2025}
}
备注
Accepted to CVPR 2025