中文

基于ViT的一次性多语言字体生成

计算机视觉与模式识别 2024-12-17 v1

摘要

字体设计对于中文、日文和韩文(CJK)等语标语言提出了独特的挑战,因为需要单独设计数千个独特的字符。本文介绍了一种新颖的基于Vision Transformer(ViT)的多语言字体生成模型,有效解决了语标和字母文字系统的复杂性。通过利用ViT和强大的视觉预训练任务(掩码自编码,MAE),我们的模型消除了先前框架中复杂设计组件的需求,同时实现了具有更强泛化能力的全面结果。值得注意的是,它能够为未见过的、未知的甚至用户自创的字符生成跨多种语言的高质量字体。此外,我们集成了一个检索增强引导(RAG)模块,动态检索和调整风格参考,提高了可扩展性和实际应用性。我们在各种字体生成任务中评估了我们的方法,证明了其有效性、适应性和可扩展性。

关键词

引用

@article{arxiv.2412.11342,
  title  = {One-Shot Multilingual Font Generation Via ViT},
  author = {Zhiheng Wang and Jiarui Liu},
  journal= {arXiv preprint arXiv:2412.11342},
  year   = {2024}
}