中文

LayoutNUWA:揭示大语言模型隐藏的布局专长

计算机视觉与模式识别 2023-09-20 v2 计算与语言

摘要

图形布局生成是一个日益增长的研究领域,在用户参与和信息感知方面发挥着重要作用。现有方法主要将布局生成视为数值优化任务,关注量化方面而忽视布局的语义信息,例如各布局元素之间的关系。本文中,我们提出 LayoutNUWA,首个将布局生成视为代码生成任务以增强语义信息并借助大语言模型(LLMs)隐藏布局专长的模型。更具体地,我们开发了代码指令微调(CIT)方法,包含三个相互关联的模块:1)代码初始化(CI)模块量化数值条件并将其初始化为带有策略性放置掩码的 HTML 代码;2)代码补全(CC)模块利用 LLM 的格式化知识填充 HTML 代码中的掩码部分;3)代码渲染(CR)模块将完成的代码转换为最终布局输出,确保高度可解释且透明的布局生成过程,直接将代码映射为可视化布局。我们在多个数据集上取得了显著的最先进性能(甚至超过 50% 的提升),展示了 LayoutNUWA 的强大能力。我们的代码可在 https://github.com/ProjectNUWA/LayoutNUWA 获取。

关键词

引用

@article{arxiv.2309.09506,
  title  = {LayoutNUWA: Revealing the Hidden Layout Expertise of Large Language Models},
  author = {Zecheng Tang and Chenfei Wu and Juntao Li and Nan Duan},
  journal= {arXiv preprint arXiv:2309.09506},
  year   = {2023}
}