中文

PixelHacker:基于结构和语义一致性的数据驱动图像填充

计算机视觉与模式识别 2025-05-01 v2

摘要

图像填充是图像编辑与图像生成之间 fundamental 的研究领域。最近的领先方法探索了新颖的注意力机制、轻量级架构和上下文感知建模,展现了令人印象深刻的性能。然而,这些方法往往在处理复杂结构(如纹理、形状、空间关系)和语义(如颜色一致性、对象恢复和逻辑正确性)时仍感困难,导致人工效应和不恰当的生成。为此,我们设计一种简单而有效的数据驱动方法,称为潜在类别指导(latent categories guidance),并进一步提出一种基于扩散模型的 PixelHacker。具体而言,我们首先构建一个包含1400万张图像-掩码对的数据集,通过标注前景和背景(分别可能包含116和21个类别)来实现。随后,我们通过两个固定大小的嵌入向量分别对潜在的前景和背景表示进行编码,并通过线性注意力机制间歇性地注入这些特征以进行去噪过程。最后,我们在数据集上进行预训练,然后在开源基准数据集上进行微调,以获得 PixelHacker。广泛的实验表明,PixelHacker 在多个数据集(Places2、CelebA-HQ 和 FFHQ)上综合优于领先方法,在结构和语义方面表现出卓越的一致性。项目页面位于 https://hustvl.github.io/PixelHacker。

关键词

引用

@article{arxiv.2504.20438,
  title  = {PixelHacker: Image Inpainting with Structural and Semantic Consistency},
  author = {Ziyang Xu and Kangsheng Duan and Xiaolei Shen and Zhifeng Ding and Wenyu Liu and Xiaohu Ruan and Xiaoxin Chen and Xinggang Wang},
  journal= {arXiv preprint arXiv:2504.20438},
  year   = {2025}
}

备注

https://hustvl.github.io/PixelHacker