通过语义预先填充提升文本引导对象填充效果
计算机视觉与模式识别
2024-09-13 v1 多媒体
摘要
近年来,大型文本到图像扩散模型的成功及其在生成高质量图像方面的卓越潜力令人瞩目。进一步追求增强图像可编辑性的目标,催生了对下游任务——即在图像中指定区域内填充由文本提示描述的新对象的 inpainting 任务的浓厚兴趣。然而,该问题从两个方面并不容易实现:1)仅依赖单一 U-Net 在所有去噪时间步上对齐文本提示和视觉对象不足以生成所需对象;2)在扩散模型复杂的采样空间中,对象生成的可控性并未得到保证。本文提出将典型的单阶段对象填充分解为两个级联过程:1)在多模态特征空间中进行语义预填充,以推断所需对象语义特征;2)在扩散潜在空间中进行高保真对象生成,依据此类填充后的语义特征。为实现此目标,我们级联一个基于 Transformer 的语义填充器和一个对象填充扩散模型,构建出一种新的 CAscaded Transformer-Diffusion(CAT-Diffusion)框架,用于文本引导对象填充。技术上,语义填充器在未遮蔽上下文和文本提示的条件下,预测目标对象的语义特征。语义填充器的输出充当信息丰富的视觉提示,以通过参考适配器层引导高保真对象生成,实现可控对象填充。在 OpenImages-V6 和 MSCOCO 上的大规模评估表明,CAT-Diffusion 在与最新方法之间具有优势。代码已公开 \url{https://github.com/Nnn-s/CATdiffusion}。
引用
@article{arxiv.2409.08260,
title = {Improving Text-guided Object Inpainting with Semantic Pre-inpainting},
author = {Yifu Chen and Jingwen Chen and Yingwei Pan and Yehao Li and Ting Yao and Zhineng Chen and Tao Mei},
journal= {arXiv preprint arXiv:2409.08260},
year = {2024}
}
备注
ECCV 2024. Source code is available at https://github.com/Nnn-s/CATdiffusion