VASCAR:通过视觉感知自校正实现内容感知的布局生成
计算机视觉与模式识别
2025-03-12 v3
摘要
大型语言模型 (LLM) 因其生成结构描述语言(如 HTML 或 JSON)的能力,已被证明对布局生成有效。在本文中,我们认为,虽然 LLM 在某些情况下可以表现得相当好,但它们无法感知图像的内在局限性限制了其在需要视觉内容的任务(例如,内容感知的布局生成)中的有效性。因此,我们探索了大型视觉-语言模型 (LVLM) 是否可以应用于内容感知的布局生成。为此,受设计师迭代修订和启发式评估工作流程的启发,我们提出了无需训练的视觉感知自校正布局生成 (VASCAR)。VASCAR 使 LVLM(例如 GPT-4o 和 Gemini)能够参考渲染的布局图像迭代地优化其输出,这些图像被可视化为海报背景(即画布)上的彩色边界框。大量实验和用户研究证明了 VASCAR 的有效性,实现了最先进的 (SOTA) 布局生成质量。此外,VASCAR 在 GPT-4o 和 Gemini 上的泛化能力证明了其多功能性。
引用
@article{arxiv.2412.04237,
title = {VASCAR: Content-Aware Layout Generation via Visual-Aware Self-Correction},
author = {Jiahao Zhang and Ryota Yoshihashi and Shunsuke Kitada and Atsuki Osanai and Yuta Nakashima},
journal= {arXiv preprint arXiv:2412.04237},
year = {2025}
}