中文

FlexEdit:结合自由形状掩码与VLLM实现灵活的图像编辑

计算机视觉与模式识别 2025-07-15 v2

摘要

将视觉大语言模型(VLLM)与扩散模型相结合,为执行基于人类语言指令的图像编辑任务提供了一种强大的方法。然而,仅凭语言指令往往难以准确传达用户需求,特别是当用户想要在图像的特定区域添加或替换元素时。幸运的是,掩码可以有效地指示要编辑的确切位置或元素,但它们要求用户在所需位置精确绘制形状,这非常不友好。为了解决这个问题,我们提出了FlexEdit,一种端到端的图像编辑方法,它利用自由形状掩码和语言指令进行灵活编辑。我们的方法采用VLLM来理解图像内容、掩码和用户指令。此外,我们引入了掩码增强适配器(MEA),它将VLLM的嵌入与图像数据融合,确保掩码信息和模型输出嵌入的无缝集成。此外,我们构建了FSMI-Edit,一个专门为自由形状掩码定制的基准,包括8种类型的自由形状掩码。大量实验表明,我们的方法在基于LLM的图像编辑中实现了最先进的性能,并且我们简单的提示技术在其有效性方面脱颖而出。代码和数据可在https://github.com/A-new-b/flex_edit找到。

关键词

引用

@article{arxiv.2408.12429,
  title  = {FlexEdit: Marrying Free-Shape Masks to VLLM for Flexible Image Editing},
  author = {Tianshuo Yuan and Yuxiang Lin and Jue Wang and Zhi-Qi Cheng and Xiaolong Wang and Jiao GH and Wei Chen and Xiaojiang Peng},
  journal= {arXiv preprint arXiv:2408.12429},
  year   = {2025}
}

备注

15 pages, 14 figures