MoEdit: 多目标图像编辑中的数量感知学习
计算机视觉与模式识别
2025-03-14 v1
摘要
多目标图像广泛存在于各种现实场景中,包括增强现实、广告设计和医学成像。对这些图像进行高效且精确的编辑对这些应用至关重要。随着Stable Diffusion(SD)的出现,高质量图像生成与编辑进入了新时代。然而,现有方法往往难以同时单独考虑每个目标以及整体图像编辑,二者对于确保一致的数量感知都至关重要,从而导致次优的感知性能。为了解决这些挑战,我们提出了MoEdit,一种无辅助工具的多目标图像编辑框架。MoEdit在风格迁移、目标重生成和背景重建方面实现了高质量多目标图像编辑,同时确保输入与输出之间的一致数量感知,即使面对大量目标也是如此。为此,我们引入了特征补偿(FeCom)模块,通过最小化中间交错来确保每个目标属性的区分性和可分离性。此外,我们提出了数量注意力(QTTN)模块,通过编辑中的有效控制来感知并保持数量一致性,而不依赖辅助工具。通过利用SD模型,MoEdit能够以高质量对输入中的特定概念进行定制化保留和修改。实验结果表明我们的MoEdit在多目标图像编辑中达到了最先进(SOTA)性能。数据和代码将在https://github.com/Tear-kitty/MoEdit公开。
引用
@article{arxiv.2503.10112,
title = {MoEdit: On Learning Quantity Perception for Multi-object Image Editing},
author = {Yanfeng Li and Kahou Chan and Yue Sun and Chantong Lam and Tong Tong and Zitong Yu and Keren Fu and Xiaohong Liu and Tao Tan},
journal= {arXiv preprint arXiv:2503.10112},
year = {2025}
}