中文

将字体图像完全解耦为风格与字符类别特征

计算机视觉与模式识别 2025-09-12 v2

摘要

在本文中,我们展示了字体图像的完全解耦。完全解耦是一种基于神经网络的方法,可将每张字体图像非线性且完整地分解为其风格和内容(即字符类别)特征。该方法使用简单但严谨的训练过程,从同一字体的所有 `A'-`Z' 图像中提取共同风格特征,并从不同字体的所有 `A'(或其他类别)图像中提取共同内容特征。这些解耦特征保证了原始字体图像的重建。我们进行了各种实验以理解完全解耦的性能。首先,证明了完全解耦可以以非常高的精度实现;这是对长期存在的开放性问题“`A'之属性是否存在?”的实验证明。其次,证明了完全解耦产生的解耦特征适用于多种任务,包括字体识别、字符识别和单样本字体图像生成。代码可在此处获取:https://github.com/uchidalab/total_disentanglement

关键词

引用

@article{arxiv.2403.12784,
  title  = {Total Disentanglement of Font Images into Style and Character Class Features},
  author = {Daichi Haraguchi and Wataru Shimoda and Kota Yamaguchi and Seiichi Uchida},
  journal= {arXiv preprint arXiv:2403.12784},
  year   = {2025}
}