LayoutTransformer:基于自注意力的布局生成与补全
计算机视觉与模式识别
2021-10-01 v2 机器学习
摘要
我们解决了面向图像、移动应用、文档和三维物体等多样领域的场景布局生成问题。大多数复杂场景,无论是自然的还是人为设计的,都可以表示为较简单组合图元的有意义排列。生成新布局或扩展现有布局需要理解这些图元之间的关系。为此,我们提出 LayoutTransformer,一种利用自注意力学习布局元素间上下文关系并在给定领域中生成新颖布局的新框架。我们的框架允许从空集或初始种子图元集生成新布局,并可轻松扩展以支持每个布局中任意数量的图元。此外,我们的分析表明,该模型能够自动捕捉图元的语义属性。我们提出了布局图元表示和训练方法的简单改进,以展示在非常多样的数据领域(如自然图像中的目标边界框(COCO bounding box)、文档(PubLayNet)、移动应用(RICO dataset)以及三维形状(Part-Net))中的竞争性能。代码及其他材料将在 https://kampta.github.io/layout 提供。
引用
@article{arxiv.2006.14615,
title = {LayoutTransformer: Layout Generation and Completion with Self-attention},
author = {Kamal Gupta and Justin Lazarow and Alessandro Achille and Larry Davis and Vijay Mahadevan and Abhinav Shrivastava},
journal= {arXiv preprint arXiv:2006.14615},
year = {2021}
}
备注
To appear at ICCV 2021