A²-Edit:基于参考图的任意对象和模糊掩码的精准图像编辑
计算机视觉与模式识别
2026-03-23 v2
摘要
我们提出A²-Edit,这是一个用于任意对象类别的统一图像填充框架,允许用户仅通过粗糙掩码将目标区域替换为参考对象。为解决现有数据集中严重的同质化问题和类别覆盖有限的挑战,我们构建了一个大规模多类别数据集UniEdit-500K,包含8大类别、209个细粒度子类别,总计500,104对图像。这种丰富的类别多样性为模型带来了新挑战,要求其自动学习跨类别的语义关系与区别。为此,我们引入混合Transformer模块,通过动态专家选择对 various object categories进行差异化建模,并通过专家间的协作进一步增强跨类别语义传递与泛化能力。此外,我们提出了掩码退火训练策略(MATS),在训练过程中逐渐放宽掩码精度,从而降低模型对准确掩码的依赖,提高了在各种编辑任务中的鲁棒性。在VITON-HD和AnyInsertion等基准测试上进行的大量实验表明,A²-Edit在所有指标上均优于现有方法,为任意对象编辑提供了一种新颖且高效的解决方案。
关键词
引用
@article{arxiv.2603.10685,
title = {A$^2$-Edit: Precise Reference-Guided Image Editing of Arbitrary Objects and Ambiguous Masks},
author = {Huayu Zheng and Guangzhao Li and Baixuan Zhao and Siqi Luo and Hantao Jiang and Guangtao Zhai and Xiaohong Liu},
journal= {arXiv preprint arXiv:2603.10685},
year = {2026}
}