SmartMask:面向细粒度物体插入与布局控制的上下文感知高保真掩码生成
计算机视觉与模式识别
2023-12-11 v1 人工智能
人机交互
机器学习
多媒体
摘要
随着近期潜在扩散模型的出现,生成式图像修复和物体插入领域取得了显著进展。利用精确的物体掩码可以极大地增强这些应用。然而,由于用户在创建高保真掩码时遇到的挑战,这些方法倾向于依赖更粗糙的掩码(例如,边界框)来完成这些应用。这导致了有限的控制和受损的背景内容保留。为了克服这些限制,我们引入了SmartMask,它允许任何新手用户创建用于精确物体插入的详细掩码。结合ControlNet-Inpaint模型,我们的实验表明,SmartMask实现了卓越的物体插入质量,比以往方法更有效地保留了背景内容。值得注意的是,与先前的工作不同,所提出的方法甚至可以在没有用户掩码引导的情况下使用,这使其能够在不同位置和尺度上执行无掩码物体插入。此外,我们发现,当与一种新颖的基于指令微调的规划模型迭代使用时,SmartMask可用于从零开始设计详细的布局。与基于用户涂鸦的布局设计相比,我们观察到SmartMask能够通过布局到图像生成方法获得更高质量的输出。项目页面可在 https://smartmask-gen.github.io 获取。
引用
@article{arxiv.2312.05039,
title = {SmartMask: Context Aware High-Fidelity Mask Generation for Fine-grained Object Insertion and Layout Control},
author = {Jaskirat Singh and Jianming Zhang and Qing Liu and Cameron Smith and Zhe Lin and Liang Zheng},
journal= {arXiv preprint arXiv:2312.05039},
year = {2023}
}