中文

LayoutBERT:用于对象插入的掩码语言布局模型

计算机视觉与模式识别 2022-05-03 v1 人工智能

摘要

图像合成是创意工作流中最基本的步骤之一。它涉及取若干图像的对象/部分来创建一幅新图像,称为合成图。目前,这一过程是通过手动创建待插入对象的精确掩码,并将其与目标场景或图像仔细混合来完成的,通常借助Photoshop或GIMP等工具。尽管在自动选择对象以创建掩码方面已有若干工作,但图像内对象以正确位置、尺度和协调性进行放置的问题仍是一个困难且探索有限的问题。图像或设计中的自动对象插入是一个困难问题,因为它需要理解场景几何以及对象间的色彩协调。我们针对对象插入任务提出LayoutBERT。它使用了一种新颖的自监督掩码语言模型目标与双向多头自注意力。它优于先前基于布局的似然模型,并在模型容量方面展现出良好特性。我们展示了我们的方法在图像合成设定以及文档和设计模板等其他设定中对象插入的有效性。我们进一步展示了所学表征对于基于布局的检索任务的实用性。我们在来自不同领域的COCO、PublayNet以及两个我们称为Image Layouts和Template Layouts的新数据集上提供了定性和定量评估。据我们所知,由580万张带布局标注的图像组成的Image Layouts是最大的图像布局数据集。我们还分享了关于数据集规模、模型规模和类样本规模对该任务影响的消融研究结果。

关键词

引用

@article{arxiv.2205.00347,
  title  = {LayoutBERT: Masked Language Layout Model for Object Insertion},
  author = {Kerem Turgutlu and Sanat Sharma and Jayant Kumar},
  journal= {arXiv preprint arXiv:2205.00347},
  year   = {2022}
}

备注

8 pages main paper, 6 pages supplemental material. Accepted to AI4CC Workshop @CVPR 2022