中文

面向视觉-文本呈现设计的组合感知图形布局GAN

计算机视觉与模式识别 2022-07-14 v3

摘要

本文研究图形布局生成问题,即为给定图像生成高质量的视觉-文本呈现设计。我们注意到,图像组合不仅包含全局语义,还包含空间信息,会在很大程度上影响布局结果。因此,我们提出了一种深度生成模型,称为组合感知图形布局GAN(CGL-GAN),基于输入图像的全局与空间视觉内容来合成布局。为了在已包含人工设计图形布局数据的图像上获取训练图像,已有工作建议将设计元素(如文本与装饰)掩码作为模型输入,这不可避免地留下了真值的痕迹。我们研究了训练输入(带提示掩码)与测试输入(无掩码)之间的错位,并设计了一种新颖的域对齐模块(DAM)来缩小这一差距。为训练,我们构建了一个大规模布局数据集,包含60,548张带有标注布局信息的广告海报。为评估生成的布局,我们基于美学直觉提出了三个新颖指标。通过定量与定性评估,我们证明了所提模型能够根据图像组合合成高质量的图形布局。

关键词

引用

@article{arxiv.2205.00303,
  title  = {Composition-aware Graphic Layout GAN for Visual-textual Presentation Designs},
  author = {Min Zhou and Chenchen Xu and Ye Ma and Tiezheng Ge and Yuning Jiang and Weiwei Xu},
  journal= {arXiv preprint arXiv:2205.00303},
  year   = {2022}
}

备注

Accepted by IJCAI 2022 (AI, THE ARTS AND CREATIVITY TRACK)