中文

掩码生成式 Transformer 是您需要的图像编辑器

计算机视觉与模式识别 2026-05-12 v1 机器学习

摘要

扩散模型主导图像编辑,但其全局去噪机制使编辑区域与周围环境相互交织,导致修改向本应保持完整的区域传播。我们提出一种根本性不同的方法,利用掩码生成式 Transformer(MGT)实现,其局部 token 预测范式自然将变更局限于预期区域。我们呈现 EditMGT,一种首次提出的 MGT 基于编辑框架。我们的方案采用多层注意力整合,将交叉注意力图聚合为精确的编辑局部分信号;并引入区域保持抽样,以显式防止非目标区域的 token 翻转。为支持训练,我们构建了 CrispEdit-2M,一个包含 200 万样本的高分辨率(>1024)编辑数据集,涵盖七个类别。仅用 9.6 亿参数,EditMGT 在多个基准上实现了领先的图像相似度,同时实现了 6 倍的编辑速度,表明 MGT 为基于扩散的编辑提供了有竞争力的替代方案。

关键词

引用

@article{arxiv.2605.10859,
  title  = {Masked Generative Transformer Is What You Need for Image Editing},
  author = {Wei Chow and Linfeng Li and Xian Sun and Lingdong Kong and Zefeng Li and Qi Xu and Hang Song and Tian Ye and Xian Wang and Jinbin Bai and Shilin Xu and Xiangtai Li and Junting Pan and Shaoteng Liu and Ran Zhou and Tianshu Yang and Songhua Liu},
  journal= {arXiv preprint arXiv:2605.10859},
  year   = {2026}
}

备注

CVPR 2026 HiGen Workshop; Project Page at https://weichow23.github.io/EditMGT/ GitHub at https://github.com/weichow23/EditMGT