中文

MagicQuillV2: 基于分层视觉线索的精确交互式图像编辑

计算机视觉与模式识别 2025-12-03 v1

摘要

我们提出了 MagicQuill V2,一个引入分层组合范式的新型生成式图像编辑系统,弥合了扩散模型的语义能力与传统图形软件精细控制之间的差距。虽然扩散变压器擅长整体生成,但其对单一、整体提示的使用无法解耦用户在内容、位置和外观方面的不同意图。为克服这一问题,我们的方法将创作意图解构为一组可控制的视觉线索栈:内容层用于创建什么,空间层用于放置位置,结构层用于形状如何,色彩层用于调色板。我们的技术贡献包括一个用于上下文感知内容集成的专用数据生成流水线、一个用于处理所有视觉线索的统一控制模块,以及一个用于精确局部编辑(包括对象移除)的微调空间分支。大量实验验证了这种分层方法有效解决了用户意图差距,赋予创作者对生成过程直接、直观的控制。

关键词

引用

@article{arxiv.2512.03046,
  title  = {MagicQuillV2: Precise and Interactive Image Editing with Layered Visual Cues},
  author = {Zichen Liu and Yue Yu and Hao Ouyang and Qiuyu Wang and Shuailei Ma and Ka Leong Cheng and Wen Wang and Qingyan Bai and Yuxuan Zhang and Yanhong Zeng and Yixuan Li and Xing Zhu and Yujun Shen and Qifeng Chen},
  journal= {arXiv preprint arXiv:2512.03046},
  year   = {2025}
}

备注

Code and demo available at https://magicquill.art/v2/