GLDesigner: 利用多模态大语言模型作为设计师以增强美学文本字形布局
计算机视觉与模式识别
2025-08-05 v2
摘要
文本标志设计在很大程度上依赖于专业设计师的创造力和专业知识,其中安排元素布局是最重要的程序之一。然而,这项特定任务受到的关注有限,常常被文档或海报设计等更广泛的布局生成任务所掩盖。在本文中,我们提出了一个基于视觉语言模型(VLM)的框架,该框架通过将多模态输入与用户定义的约束相结合,生成内容感知的文本标志布局,从而为现实世界的应用实现更灵活、更鲁棒的布局生成。我们引入了两种模型技术,可以在不牺牲性能的情况下降低同时处理多个字形图像的计算成本。为了支持我们模型的指令微调,我们构建了两个广泛的文本标志数据集,其规模是现有公共数据集的五倍。除了几何标注(例如,文本掩码和字符识别)之外,我们的数据集还包括自然语言的详细布局描述,使模型能够更有效地推理处理复杂设计和自定义用户输入。实验结果证明了我们提出的框架和数据集的有效性,在评估几何美学和人类偏好的各种基准上优于现有方法。
引用
@article{arxiv.2411.11435,
title = {GLDesigner: Leveraging Multi-Modal LLMs as Designer for Enhanced Aesthetic Text Glyph Layouts},
author = {Junwen He and Yifan Wang and Lijun Wang and Huchuan Lu and Jun-Yan He and Chenyang Li and Hanyuan Chen and Jin-Peng Lan and Bin Luo and Yifeng Geng},
journal= {arXiv preprint arXiv:2411.11435},
year = {2025}
}
备注
ACM Multimedia 2025