中文

FontUse:面向风格与用例条件的图像内排版数据驱动方法

计算机视觉与模式识别 2026-03-09 v1 图形学

摘要

最近的文本到图像模型能够生成高质量图像,但控制排版仍具有挑战性:所请求的排版外观常被忽视或仅轻微遵循。我们采用数据驱动方法,通过针对排版的结构化标注管道生成的监督信息训练图像生成模型。我们的管道构建了约 7 万张标注了用户友好提示、文本区域位置和 OCR 识别字符串的大型排版数据集 FontUse。标注通过分割模型和多模态大语言模型(MLLM)自动生成。提示显式结合字体风格(如衬线体、脚本体、优雅体)和用例(如婚礼邀请、咖啡店菜单),即使对于初学者用户也能直观指定。通过这些标注微调现有生成器,使其能够在不进行架构修改的情况下,将风格和用例条件解释为文本提示。为评估,我们引入基于 Long-CLIP 的指标,以衡量生成排版与请求属性之间的对齐程度。在多样化提示和布局实验中,我们的方法生成的文本渲染更符合提示要求,优于对手基线方法。我们的标注管道源码已公开于 https://github.com/xiaxinz/FontUSE。

关键词

引用

@article{arxiv.2603.06038,
  title  = {FontUse: A Data-Centric Approach to Style- and Use-Case-Conditioned In-Image Typography},
  author = {Xia Xin and Yuki Endo and Yoshihiro Kanamori},
  journal= {arXiv preprint arXiv:2603.06038},
  year   = {2026}
}