EditMGT:解锁遮盖生成式转换器在图像编辑中的潜能
计算机视觉与模式识别
2026-03-26 v2 多媒体
图像与视频处理
摘要
近期扩散模型(DM)在图像编辑任务中取得了卓越的视觉质量,但其全局去噪动力学本质上会将局部编辑目标与整个图像上下文融合,导致非目标区域出现意外修改。在本文中,我们转向注意力Beyond DM,转而关注遮盖生成式转换器(MGT)以解决这一挑战。通过预测多个被遮盖标记,而非整体精炼,MGT展现出局部解码范式,具备在编辑过程中显式保留非相关区域的内在能力。基于这一洞见,我们引入首个基于MGT的图像编辑框架,称为EditMGT。我们首先演示MGT的跨注意力图为局部化编辑区域提供信息性信号,并设计多层注意力整合方案以细化这些图,从而实现精细而精确的局部化。基于这些自适应局部化结果,我们引入区域保持采样,该方法限制低注意力区域内的标记翻转,以抑制不必要的编辑,从而将修改限制在预期目标区域,保留周围非目标区域的完整性。为训练EditMGT,我们构建了CrispEdit-2M,一个覆盖七种多样化编辑类别的高分辨率数据集。无需引入额外参数,我们通过注意力注入将预训练的文本到图像MGT适配为图像编辑模型。广泛的实验在四个标准基准上表明,本模型在参数不足10亿的情况下,实现了接近的性能,同时使编辑速度提升了6倍。此外,它在风格变化和风格迁移任务上分别实现了3.6%和17.6%的编辑质量提升。
引用
@article{arxiv.2512.11715,
title = {EditMGT: Unleashing Potentials of Masked Generative Transformers in Image Editing},
author = {Wei Chow and Linfeng Li and Lingdong Kong and Zefeng Li and Qi Xu and Hang Song and Tian Ye and Xian Wang and Jinbin Bai and Shilin Xu and Xiangtai Li and Junting Pan and Shaoteng Liu and Ran Zhou and Tianshu Yang and Songhua Liu},
journal= {arXiv preprint arXiv:2512.11715},
year = {2026}
}