用于内容感知布局生成的检索增强布局 Transformer
计算机视觉与模式识别
2024-04-17 v4
摘要
内容感知图形布局生成旨在根据给定的内容(如电商产品图像)自动排布视觉元素。本文指出,当前布局生成方法受限于高维布局结构训练数据的不足。我们展示简单的检索增强可显著提升生成质量。我们的模型名为检索增强布局 Transformer(RALF),基于输入图像检索最近邻布局示例,并将这些结果送入自回归生成器。我们的模型可将检索增强应用于多种可控生成任务,并在统一架构内产出高质量布局。大量实验表明,RALF 在约束与非约束设定下均能成功生成内容感知布局,并显著优于基线。
引用
@article{arxiv.2311.13602,
title = {Retrieval-Augmented Layout Transformer for Content-Aware Layout Generation},
author = {Daichi Horita and Naoto Inoue and Kotaro Kikuchi and Kota Yamaguchi and Kiyoharu Aizawa},
journal= {arXiv preprint arXiv:2311.13602},
year = {2024}
}
备注
Accepted to CVPR 2024 (Oral), Project website: https://udonda.github.io/RALF/ , GitHub: https://github.com/CyberAgentAILab/RALF