面向图像条件布局生成的几何对齐变分Transformer
计算机视觉与模式识别
2022-09-05 v1 多媒体
摘要
布局生成是计算机视觉中的一项新任务,它结合了目标定位与美学评价两方面的挑战,广泛应用于广告、海报和幻灯片设计。准确且美观的布局应同时考虑布局元素内部的域内关系以及布局元素与图像之间的域间关系。然而,以往大多数方法仅关注与图像内容无关的布局生成,未能利用图像中复杂的视觉信息。为此,我们探索了一种称为图像条件布局生成的新范式,旨在以语义连贯的方式向图像添加文本叠加层。具体而言,我们提出了一种图像条件变分Transformer(ICVT),它以自回归方式在图像中生成多样化布局。首先,采用自注意力机制建模布局元素内部的上下文关系,同时使用交叉注意力机制融合条件图像的视觉信息。随后,我们将它们作为条件变分自编码器(CVAE)的构建模块,展现出良好的多样性。其次,为缓解布局元素域与视觉域之间的鸿沟,我们设计了一个几何对齐模块,将图像的几何信息与布局表示对齐。此外,我们构建了一个带有精细布局与显著性图标注的大规模广告海报布局设计数据集。实验结果表明,我们的模型能够自适应地在图像的非侵入区域生成布局,从而实现和谐的布局设计。
引用
@article{arxiv.2209.00852,
title = {Geometry Aligned Variational Transformer for Image-conditioned Layout Generation},
author = {Yunning Cao and Ye Ma and Min Zhou and Chuanbin Liu and Hongtao Xie and Tiezheng Ge and Yuning Jiang},
journal= {arXiv preprint arXiv:2209.00852},
year = {2022}
}
备注
To be published in ACM MM 2022