中文

面向支持排版设计的自动文本框放置

计算机视觉与模式识别 2025-10-10 v1

摘要

在广告和网页布局设计中,平衡视觉吸引力与沟通效率至关重要。本研究考察了在不完整布局中进行自动文本框放置的问题,比较了标准基于Transformer的方法、小型视觉语言模型(Phi3.5-vision)、大型预训练视觉语言模型(Gemini)以及处理多个图像的扩展Transformer。针对Crello数据集进行评估显示,标准基于Transformer的模型通常优于视觉语言模型方法,尤其在融合更丰富的外观信息后效果更佳。然而,所有方法在处理极小文本或密集布局时都面临挑战。这些发现凸显了任务特定架构的优势,并为后续在自动化布局设计方面的改进提供了思路。

关键词

引用

@article{arxiv.2510.07665,
  title  = {Automatic Text Box Placement for Supporting Typographic Design},
  author = {Jun Muraoka and Daichi Haraguchi and Naoto Inoue and Wataru Shimoda and Kota Yamaguchi and Seiichi Uchida},
  journal= {arXiv preprint arXiv:2510.07665},
  year   = {2025}
}