中文

图像内主体重定位

计算机视觉与模式识别 2024-11-20 v3

摘要

当前的图像处理主要集中于静态操作,例如替换图像内的特定区域或改变其整体风格。在本文中,我们引入了一项创新的动态操作任务:主体重定位。该任务涉及将用户指定的主体移动到期望的位置,同时保持图像的保真度。我们的研究表明,主体重定位的基本子任务,包括填补主体重定位后留下的空白、重建主体被遮挡的部分以及将主体与周围区域进行融合以保持一致,可以有效地重新表述为一个统一的、提示引导的修复任务。因此,我们可以使用单个扩散生成模型,通过我们提出的任务反转技术学习到的各种任务提示来解决这些子任务。此外,我们整合了预处理和后处理技术,以进一步提高主体重定位的质量。这些元素共同构成了我们的分割-生成-融合(SEELE)框架。为了评估 SEELE 在主体重定位中的有效性,我们构建了一个名为 ReS 的真实世界主体重定位数据集。SEELE 在 ReS 上的结果证明了其有效性。代码和 ReS 数据集可在 https://yikai-wang.github.io/seele/ 获取。

关键词

引用

@article{arxiv.2401.16861,
  title  = {Repositioning the Subject within Image},
  author = {Yikai Wang and Chenjie Cao and Ke Fan and Qiaole Dong and Yifan Li and Xiangyang Xue and Yanwei Fu},
  journal= {arXiv preprint arXiv:2401.16861},
  year   = {2024}
}

备注

Accepted by TMLR. Arxiv version uses small size images. Full size PDF, code, and dataset are available at https://yikai-wang.github.io/seele/