基于内容感知的视觉语言模型中两阶段链式思维广告横幅布局生成
计算机视觉与模式识别
2025-12-16 v1 人工智能
摘要
本文提出了一种利用视觉语言模型 (VLM) 生成图像式广告布局的方法。传统的广告布局技术主要依赖显著性图映射来检测背景图像中的显著区域,但此类方法往往未能充分考虑图像的细节构图和语义内容。为克服这一局限性,我们的方法运用VLM识别背景图像中所呈现的产品及其他要素,并据此指导文本和标志的摆放位置。该布局生成管道包含两个步骤:第一步中,VLM分析图像以识别物体类型及其空间关系,然后基于此分析生成以文本形式的“布局计划”;第二步中,将该计划渲染为最终布局,通过生成HTML格式代码实现。我们通过评估实验验证了该方法的有效性,进行了针对现有方法的定性和定量比较。实验结果表明,通过显式考虑背景图像的内容,本方法能够产生显著提升的广告布局质量。
引用
@article{arxiv.2512.12596,
title = {Content-Aware Ad Banner Layout Generation with Two-Stage Chain-of-Thought in Vision Language Models},
author = {Kei Yoshitake and Kento Hosono and Ken Kobayashi and Kazuhide Nakata},
journal= {arXiv preprint arXiv:2512.12596},
year = {2025}
}