对齐稳定图像修复:缓解不期望物体插入并保持颜色一致性
摘要
生成式图像修复即使面对大尺度、不规则掩码也能产生逼真、高保真的结果。然而,现有方法仍面临导致修复图像看起来不自然的关键问题。在本文中,我们指出了两个主要问题:(1)不期望的物体插入:生成模型可能在掩码区域产生与周围上下文不匹配的任意幻觉物体。(2)颜色不一致:修复区域常表现出明显的颜色偏移,导致纹理涂抹和图像质量下降。我们分析了这些问题的根本原因,并为预训练修复模型提出了高效的事后解决方案。具体而言,我们引入了具有未知区域先验的对齐稳定修复(ASUKA)原则性框架。为了减少不期望的物体插入,我们使用基于重建的先验来引导生成模型,在保留生成灵活性的同时抑制幻觉物体。为了解决颜色不一致问题,我们设计了一个专门的 VAE 解码器,将潜空间到图像的解码表述为局部调和任务。该设计显著减少了颜色偏移,并产生了更具颜色一致性的结果。我们在两种代表性的修复架构上实现了 ASUKA:基于 U-Net 的模型和基于 DiT 的模型。我们分析并提出了轻量级注入策略,在确保缓解上述两个问题的同时,最小化对模型原始生成能力的干扰。我们使用 Places2 数据集和我们提出的多样化基准 MISATO 对 ASUKA 进行了评估。实验表明,ASUKA 有效抑制了物体幻觉并提高了颜色一致性,优于标准扩散模型、校正流模型及其他修复方法。数据集、模型和代码将在 GitHub 上发布。
引用
@article{arxiv.2601.15368,
title = {Aligned Stable Inpainting: Mitigating Unwanted Object Insertion and Preserving Color Consistency},
author = {Yikai Wang and Junqiu Yu and Chenjie Cao and Xiangyang Xue and Yanwei Fu},
journal= {arXiv preprint arXiv:2601.15368},
year = {2026}
}
备注
Extension of our CVPR 2025 highlight paper: arXiv:2312.04831. The paper was submitted to cs.CV but was classified under eess.IV. The authors made an appeal but have not received a response for one month. Therefore, we update the comment to clarify the category