中文

面向图像编辑的物体感知反演与重组

计算机视觉与模式识别 2024-03-19 v2

摘要

通过比较原始提示与目标提示,我们可获得大量编辑对,每对包含一个物体及其对应编辑目标。为在保持输入图像保真度的同时实现可编辑性,现有编辑方法通常采取固定步数的反演将整张输入图像投影至更噪声的潜表示,随后在目标提示引导下去噪。然而,我们发现不同编辑对间实现理想编辑结果的最优反演步数差异显著,源于编辑难度不同。因此,当前依赖固定反演步数的文献产生次优生成质量,尤其在处理自然图像中多个编辑对时。为此,我们提出一种称为物体感知反演与重组(OIR)的新图像编辑范式,以实现物体级细粒度编辑。具体而言,我们设计了一种新搜索度量,通过联合考虑目标的可编辑性与非编辑区域的保真度,来确定每个编辑对的最优反演步数。我们使用该搜索度量在编辑图像时为每个编辑对寻找最优反演步。随后我们分别编辑这些编辑对以避免概念错配。接着,我们提出额外的重组步骤,将各自编辑结果与非编辑区域无缝整合以获得最终编辑图像。为系统评估方法有效性,我们收集了两个称为 OIRBench 的数据集,分别用于单物体与多物体编辑基准测试。实验表明,我们的方法在物体形状、颜色、材质、类别等编辑上取得优越性能,尤其在多物体编辑场景中。

关键词

引用

@article{arxiv.2310.12149,
  title  = {Object-aware Inversion and Reassembly for Image Editing},
  author = {Zhen Yang and Ganggui Ding and Wen Wang and Hao Chen and Bohan Zhuang and Chunhua Shen},
  journal= {arXiv preprint arXiv:2310.12149},
  year   = {2024}
}

备注

Project Page: https://aim-uofa.github.io/OIR-Diffusion/