FontCrafter:基于视觉上下文生成的高保真元素驱动艺术字体创建
计算机视觉与模式识别
2026-03-31 v2
摘要
艺术字体生成旨在基于参考风格合成风格化字形。然而,现有方法受限于风格多样性和粗糙的控制。本文探索了元素驱动的艺术字体生成潜力。元素是字体的基本视觉单元,作为所需风格的参考图像。概念上,我们将元素分为具有不同结构的物体元素(如花朵或石头)和具有非结构化纹理的无定形元素(如火焰或云)。我们提出了 FontCrafter,一个元素驱动的字体创建框架,并构建了大规模数据集 ElementFont,其中包含多样化的元素类型和高质量的字形图像。然而,实现对参考元素纹理和结构的高保真重建仍具有挑战。为此,我们提出了将元素图像作为视觉上下文并使用填充模型在像素级别将元素风格传递到字形区域的“上下文生成”策略。此外,我们设计了轻量级的 Context-aware Mask Adapter(CMA),以注入形状信息。此外,一种无训练的注意力重定向机制实现区域感知的风格控制并抑制笔画幻觉。此外,应用边缘重绘使边界更自然。广泛的实验表明,FontCrafter 在零样本生成方面表现优异,尤其在保持结构和纹理保真度方面,同时支持风格混合等灵活控制。
关键词
引用
@article{arxiv.2603.22054,
title = {FontCrafter: High-Fidelity Element-Driven Artistic Font Creation with Visual In-Context Generation},
author = {Wuyang Luo and Chengkai Tan and Chang Ge and Binye Hong and Su Yang and Yongjiu Ma},
journal= {arXiv preprint arXiv:2603.22054},
year = {2026}
}
备注
To appear in CVPR 2026