中文

BannerAgency:基于多模态大语言模型智能体的广告横幅设计

计算机视觉与模式识别 2025-08-22 v2

摘要

广告横幅对于吸引用户注意力和提升广告活动效果至关重要。由于涉及多个设计元素的大型搜索空间,在传达活动信息的同时创建美观的横幅设计具有挑战性。此外,广告商需要针对不同展示尺寸的多种大小以及针对不同受众群体的多个版本。由于设计本质上是一个迭代且主观的过程,灵活的可编辑性在实际应用中也备受需求。虽然当前模型在各种设计任务中已作为人类设计师的助手,但它们通常仅处理创意设计过程的片段,或产生限制可编辑性的基于像素的输出。本文引入了一个无需训练的框架,用于全自动创建横幅广告设计,使前沿多模态大语言模型(MLLM)能够在多样化的营销情境中以最少的人工精力简化有效横幅的制作。我们提出了 BannerAgency,这是一个 MLLM 智能体系统,它与广告商协作以理解其品牌标识和横幅目标,生成匹配的背景图像,为前景设计元素创建蓝图,并将最终创意渲染为 Figma 或 SVG 格式的可编辑组件,而非静态像素。为了促进评估和未来研究,我们引入了 BannerRequest400,这是一个包含 100 个独特徽标和 400 个不同横幅请求的基准测试。通过定量和定性评估,我们证明了该框架的有效性,强调了所生成横幅设计的质量、它们对各种横幅请求的适应性,以及这种基于组件的方法所赋予的强大可编辑性。

关键词

引用

@article{arxiv.2503.11060,
  title  = {BannerAgency: Advertising Banner Design with Multimodal LLM Agents},
  author = {Heng Wang and Yotaro Shimose and Shingo Takamatsu},
  journal= {arXiv preprint arXiv:2503.11060},
  year   = {2025}
}

备注

Accepted as a main conference paper at EMNLP 2025