IMAGHarmony:具有一致物体数量与布局的可控图像编辑
计算机视觉与模式识别
2026-03-30 v3
摘要
尽管基于扩散的图像编辑取得了进展,但操纵多物体场景仍然具有挑战性。现有方法通常以牺牲结构一致性为代价实现语义改变,无法在不引入意外重定位或背景修改的情况下保留精确的物体数量和空间布局。为了解决这一局限性,我们引入了数量与布局一致的图像编辑(QL-Edit),在修改物体语义的同时保持原始实例基数和空间布局。我们提出了IMAGHarmony,这是一个参数高效的框架,具有和谐感知(HA)模块,将来自参考图像的感知线索纳入扩散过程。这使得模型能够联合推理物体语义、数量和空间位置,以提升结构一致性。此外,我们引入了一种偏好引导的噪声选择(PNS)策略,该策略识别有利的初始化条件,显著提高了在具有挑战性的多物体场景中的生成稳定性。为了支持系统性评估,我们构建了HarmonyBench,这是一个旨在衡量在数量和布局约束下语义编辑准确性和结构一致性的基准测试。大量实验表明,IMAGHarmony在结构保持和语义准确性方面均持续优于现有方法。值得注意的是,我们的框架非常高效,仅需200张训练图像和10.6M可训练参数。代码、模型和数据可在 \url{https://github.com/muzishen/IMAGHarmony} 获取。
引用
@article{arxiv.2506.01949,
title = {IMAGHarmony: Controllable Image Editing with Consistent Object Quantity and Layout},
author = {Fei Shen and Yutong Gao and Jian Yu and Xiaoyu Du and Jinhui Tang},
journal= {arXiv preprint arXiv:2506.01949},
year = {2026}
}