VecGlypher:基于语言模型的统一向量字形生成
摘要
向量字形是数字排版的基本单元,但大多数基于学习的管道仍依赖精心策划的 exemplar 表和 raster-to-vector 后处理,这限制了可及性和可编辑性。我们引入 VecGlypher,一个单一的多模态语言模型,直接从文本描述或图像 exemplar 生成高保真度向量字形。给定 style 提示、可选的参考字形图像和目标字符,VecGlypher 按顺序发射 SVG 路径 token,规避 raster 中间过程,生成可编辑、密封的轮廓。排版感知的数据和训练配方使得可能:(i) 在 39K 噪声 Envato 字体上进行大规模 continuation 阶段,以掌握 SVG 语法和长期几何结构,随后是 (ii) 在 2.5K 由 Google Fonts 提供的 expert 标注数据上进行后训练,包含描述性标签和 exemplar,以将 language 和 imagery 对齐到几何结构;预处理规范化坐标系,标准化路径,去重 family,并对坐标进行量化以实现稳定的长序列解码。在跨族 OOD 评估中,VecGlypher 在 text-only 生成方面显著优于通用 LLM 和专业化向量字体基线,而在图像参考生成方面达到 state-of-the-art 性能,相较于 DeepVecFont-v2 和 DualVector 实现显著提升。消融实验表明,模型规模和两阶段配方至关重要,绝对坐标序列化yield 最佳几何。VecGlypher降低了字体创建的门槛,让用户能够用单词或 exemplar 进行设计,并为未来多模态设计工具提供可扩展的基础。
引用
@article{arxiv.2602.21461,
title = {VecGlypher: Unified Vector Glyph Generation with Language Models},
author = {Xiaoke Huang and Bhavul Gauri and Kam Woh Ng and Tony Ng and Mengmeng Xu and Zhiheng Liu and Weiming Ren and Zhaochong An and Zijian Zhou and Haonan Qiu and Yuyin Zhou and Sen He and Ziheng Wang and Tao Xiang and Xiao Han},
journal= {arXiv preprint arXiv:2602.21461},
year = {2026}
}
备注
Accepted to CVPR'26. Project page: https://xk-huang.github.io/VecGlypher/