超越拼图:面向多模态少样本字体生成的全局感知自回归模型
计算机视觉与模式识别
2026-05-19 v2 多媒体
摘要
手动字体设计是一个将风格化视觉概念转化为连贯字形集的复杂过程。这一挑战在自动化少样本字体生成(FFG)中依然存在,由于模型常常难以在有限的参考资料中保持结构完整性和风格忠实性。虽然自回归(AR)模型已在生成方面展现出惊人的能力,但其在FFG中的应用受到传统拼贴级别分词的限制,这忽略了对于连贯字体合成至关重要的全局依赖。此外,现有的FFG方法仍局限于图像到图像范式,仅依赖视觉参考,忽视了语言在字体设计过程中传递风格意图的作用。为此,我们提出GAR-Font,一个新的AR框架,用于多模态少样本字体生成。GAR-Font引入了全局感知分词器,有效捕获局部结构和全局风格模式;开发了多模态风格编码器,通过轻量级的语言-风格适配器实现灵活的风格控制,无需 intensive 多模态预训练;并设计了后处理精炼流程进一步提升结构忠实性和风格一致性。广泛的实验表明,GAR-Font优于现有的FFG方法,在保持全局风格忠实性方面表现突出,并能实现更高质量的结果。
引用
@article{arxiv.2601.01593,
title = {Beyond Patches: Global-aware Autoregressive Model for Multimodal Few-Shot Font Generation},
author = {Haonan Cai and Yuxuan Luo and Zhouhui Lian},
journal= {arXiv preprint arXiv:2601.01593},
year = {2026}
}
备注
28 pages, Accepted as CVPR 2026 Conference Paper