中文

超越简单编辑:用于复杂指令驱动图像编辑的 X-Planner

计算机视觉与模式识别 2025-07-08 v1

摘要

近期基于扩散模型的图像编辑方法在文本引导任务上取得了显著进展,但往往难以解释复杂、间接的指令。此外,当前模型常存在身份保持性差、产生非预期编辑或严重依赖手动掩码等问题。为应对这些挑战,我们引入了 X-Planner,一个基于多模态大语言模型(MLLM)的规划系统,能够有效地将用户意图与编辑模型能力相连接。X-Planner 采用思维链推理,将复杂指令系统地分解为更简单、清晰的子指令。对于每个子指令,X-Planner 自动生成精确的编辑类型和分割掩码,消除了人工干预并确保了局部化、保持身份的编辑。此外,我们提出了一种新颖的自动化数据生成流水线来训练 X-Planner,在现有基准测试和我们新引入的复杂编辑基准测试上均取得了 SOTA 结果。

关键词

引用

@article{arxiv.2507.05259,
  title  = {Beyond Simple Edits: X-Planner for Complex Instruction-Based Image Editing},
  author = {Chun-Hsiao Yeh and Yilin Wang and Nanxuan Zhao and Richard Zhang and Yuheng Li and Yi Ma and Krishna Kumar Singh},
  journal= {arXiv preprint arXiv:2507.05259},
  year   = {2025}
}

备注

Project page: https://danielchyeh.github.io/x-planner/