定位、分配、细化:驾驭定制化可提示图像修复
计算机视觉与模式识别
2025-01-23 v2
摘要
先前的研究在由文本描述或主体图像引导的图像修复方面取得了显著进展。然而,关于在灵活引导或控制(即纯文本、纯图像及其组合)下的图像修复研究仍处于早期阶段。因此,在本文中,我们引入了多模态可提示图像修复项目:用于驾驭定制化图像修复的新任务模型和数据。我们提出了 LAR-Gen,一种新颖的图像修复方法,该方法结合了文本提示和图像提示,能够对图像中对应掩码提示的特定区域进行无缝修复。我们的 LAR-Gen 采用由粗到细的方式,以确保源图像的上下文一致性、主体身份一致性、对文本描述的局部语义一致性以及平滑度一致性。它包含三个机制: 定位机制:将噪声与掩码场景图像拼接以实现精确的区域编辑; 分配机制:采用解耦的交叉注意力机制以适应多模态引导; 细化机制:使用新颖的 RefineNet 补充主体细节。此外,为了解决训练数据稀缺的问题,我们引入了一种新颖的数据引擎,利用公开可用的预训练大模型,从海量图像数据中自动提取大量由局部文本提示和对应视觉实例组成的数据对。大量实验和各种应用场景证明了 LAR-Gen 在身份保持和文本语义一致性方面的优越性。
引用
@article{arxiv.2403.19534,
title = {Locate, Assign, Refine: Taming Customized Promptable Image Inpainting},
author = {Yulin Pan and Chaojie Mao and Zeyinzi Jiang and Zhen Han and Jingfeng Zhang and Xiangteng He},
journal= {arXiv preprint arXiv:2403.19534},
year = {2025}
}
备注
11 pages, 17 figures