中文

语义引导的多掩码图像协调

计算机视觉与模式识别 2022-07-26 v1 图像与视频处理

摘要

以往的协调方法侧重于基于输入掩码调整图像中一个不协调区域。当处理不同语义区域上不同扰动且无可用输入掩码时,它们可能面临问题。为处理一幅图像被粘贴来自不同图像的多个前景、且需在无任何掩码输入的情况下将其向不同域方向协调的问题,我们提出了一种新的语义引导多掩码图像协调任务。与以往的单掩码图像协调任务不同,每幅不协调图像根据语义分割掩码以不同方法被扰动。我们基于 1501501919 个语义类别分别构建了两个具有挑战性的基准 HScene 和 HLIP。此外,以往基线侧重于回归协调图像每个像素的精确值,生成结果处于“黑盒”中且不可编辑。在本工作中,我们提出一种通过预测一系列算子掩码来编辑不协调图像的新方式。这些掩码指示在特定维度上应用某项图像编辑操作(可为亮度、饱和度和颜色)的层级与位置。算子掩码为用户进一步编辑图像提供了更大灵活性。大量实验验证,当扰动为结构性时,基于算子掩码的网络能进一步提升那些直接回归 RGB 图像的 SOTA 方法。我们在所构建的基准上进行了实验,验证了所提基于算子掩码的框架能在更复杂场景中定位并修改不协调区域。我们的代码与模型见 https://github.com/XuqianRen/Semantic-guided-Multi-mask-Image-Harmonization.git。

关键词

引用

@article{arxiv.2207.11722,
  title  = {Semantic-guided Multi-Mask Image Harmonization},
  author = {Xuqian Ren and Yifan Liu},
  journal= {arXiv preprint arXiv:2207.11722},
  year   = {2022}
}