面向无掩码局部图像编辑的区域感知适配器注入
计算机视觉与模式识别
2026-05-01 v2
摘要
大型扩散转换器(DiTs)遵循全局编辑指令能力良好,但始终会将局部编辑泄漏到不相关区域,因为联合注意力架构没有明确的通道告诉网络在何处应用编辑。我们引入 AdaptEdit,一个 co-train 且指令-区域感知的适配器框架,将冻结的 DiT 转换为精确的局部编辑器,而无需修改其 backbone 权重。在每个转换器块上,一个轻量级 Block Adapter 注入一个结构化的条件流,将编辑要素(指令语义)与编辑位置(空间掩码)进行因子化;一个学习到的 SpatialGate 将适配器信号选择性地路由到编辑区域,同时保持其余图像与源图像几乎相同;以及一个区域感知损失将训练目标聚焦于更改的像素。由于这些组件使 backbone 的内部表示在端到端上变得掩码感知,一个薄的 MaskPredictor 头可与编辑器共同训练,直接从指令和源图像中对编辑区域进行 grounding,从而在部署时消除用户-掩码需求。我们在两个互补的基准测试上进行评估:MagicBrush(带有配对 ground-truth 目标)用于衡量像素级保护和编辑精度,以及 Emu-Edit Test(无 ground-truth 图像,9 种 diverse 编辑类别)用于检验指令遵循和跨编辑类型的泛化能力。在两者上,AdaptEdit 实现了状态的最佳结果,同时超越了无掩码和 oracle-掩码 baseline。一个七变消融实验清晰地隔离了每个组件的贡献。
引用
@article{arxiv.2604.23763,
title = {Edit Where You Mean: Region-Aware Adapter Injection for Mask-Free Local Image Editing},
author = {Honghao Cai and Xiangyuan Wang and Yunhao Bai and Haohua Chen and Tianze Zhou and Runqi Wang and Wei Zhu and Yibo Chen and Xu Tang and Yao Hu and Zhen Li},
journal= {arXiv preprint arXiv:2604.23763},
year = {2026}
}