中文

SmartFreeEdit:基于自然语言指令的无掩码空间感知图像编辑

计算机视觉与模式识别 2025-11-04 v2 多媒体

摘要

最近的图像编辑研究利用大规模多模态模型,实现通过自然语言指令进行直观、自然的交互。然而,传统方法在空间推理、精确区域分割以及保持语义一致性方面面临诸多挑战,尤其是在复杂场景中。为克服这些挑战,我们提出了SmartFreeEdit——一种新颖的端到端框架,将多模态大语言模型(MLLM)与图谱增强的图像填充架构集成,实现仅通过自然语言指令进行精确、无掩码图像编辑。SmartFreeEdit的关键创新包括:(1)引入区域感知标记和掩码嵌入范式,增强对复杂场景的空间理解;(2)设计一种推理分割管道,优化基于自然语言指令的编辑掩码生成;(3)图谱增强的图像填充模块,确保在复杂编辑过程中保持结构完整性和语义一致性,克服了基于局部的图像生成方法的局限。大量实验表明,SmartFreeEdit在Reason-Edit基准测试中,在分割精度、指令遵循性和视觉质量保持等多个评估指标上超越了当前最先进的方法,同时解决了局部信息聚焦问题,提高了编辑图像的全局一致性。我们的项目已公开于https://github.com/smileformylove/SmartFreeEdit。

关键词

引用

@article{arxiv.2504.12704,
  title  = {SmartFreeEdit: Mask-Free Spatial-Aware Image Editing with Complex Instruction Understanding},
  author = {Qianqian Sun and Jixiang Luo and Dell Zhang and Xuelong Li},
  journal= {arXiv preprint arXiv:2504.12704},
  year   = {2025}
}