中文

用于内容感知布局生成的检索增强布局 Transformer

计算机视觉与模式识别 2024-04-17 v4

摘要

内容感知图形布局生成旨在根据给定的内容(如电商产品图像)自动排布视觉元素。本文指出,当前布局生成方法受限于高维布局结构训练数据的不足。我们展示简单的检索增强可显著提升生成质量。我们的模型名为检索增强布局 Transformer(RALF),基于输入图像检索最近邻布局示例,并将这些结果送入自回归生成器。我们的模型可将检索增强应用于多种可控生成任务,并在统一架构内产出高质量布局。大量实验表明,RALF 在约束与非约束设定下均能成功生成内容感知布局,并显著优于基线。

关键词

引用

@article{arxiv.2311.13602,
  title  = {Retrieval-Augmented Layout Transformer for Content-Aware Layout Generation},
  author = {Daichi Horita and Naoto Inoue and Kotaro Kikuchi and Kota Yamaguchi and Kiyoharu Aizawa},
  journal= {arXiv preprint arXiv:2311.13602},
  year   = {2024}
}

备注

Accepted to CVPR 2024 (Oral), Project website: https://udonda.github.io/RALF/ , GitHub: https://github.com/CyberAgentAILab/RALF