区域-区域:基于自适应区域注入增强生成图像和谐化
计算机视觉与模式识别
2025-08-14 v1 人工智能
摘要
图像和谐化的目标是调整合成图像中前景,使其与背景实现视觉一致性。最近将潜在扩散模型(LDM)应用于和谐化,取得了显著效果。然而,LDM 基于的和谐化面临细节保留和和谐化能力有限的挑战。此外,现有合成数据集依赖于颜色迁移,缺乏局部变化,无法捕捉复杂真实场景中的光照条件。为增强和谐化能力,本文提出区域-区域(Region-to-Region)转换。通过将适当区域的信息注入前景,该方法在实现图像和谐化的同时保留原始细节,反之亦然——从而生成新的合成数据。基于此,我们提出了一种新型模型 R2R。具体而言,我们设计 Clear-VAE 采用自适应滤波器保留前景的高频细节,同时消除不和谐的元素。进一步提升和谐化效果,本文引入具备掩码感知自适应通道注意力(MACA)的和谐控制器,动态调整前景基于前景与背景区域的通道重要性。为解决现有数据集的局限性,本文提出随机泊松混合(Random Poisson Blending)方法,将适当区域的颜色和光照信息传递至前景,从而生成更具多样性和挑战性的合成图像。使用此方法,我们构建了一个新的合成数据集 RPHarmony。实验结果表明,我们的方法在定量指标和视觉和谐性方面均优于其他方法。此外,我们的数据集有助于模型在真实案例中生成更真实的图像。我们的代码、数据集和模型权重已全部开放获取。
引用
@article{arxiv.2508.09746,
title = {Region-to-Region: Enhancing Generative Image Harmonization with Adaptive Regional Injection},
author = {Zhiqiu Zhang and Dongqi Fan and Mingjie Wang and Qiang Tang and Jian Yang and Zili Yi},
journal= {arXiv preprint arXiv:2508.09746},
year = {2025}
}