学习字距调整:最优字母空间的整体估计
计算机视觉与模式识别
2024-04-30 v2
摘要
字距调整(Kerning)的任务是为某种字体的所有可能字母对设置合适的水平间距。字距调整的难点之一在于,合适的间距因字母对而异。因此,对于总共 52 个大写和小写字母,我们需要调整 个不同的间距。另一个难点是既没有通用的自动字距调整程序也没有标准;因此,字距调整仍依靠人工或启发式方法完成。本文通过提出两种机器学习模型(称为成对模型和整体模型)来解决字距调整问题。前者是一个简单的深度神经网络,用于估计给定两个字母图像的字母间距。相比之下,后者是一个基于 Transformer 的模型,用于估计给定三个或更多字母图像的字母间距。例如,整体模型可同时为某种字体的 52 个字母图像估计 2704 个间距。在这两种模型中,整体模型不仅更高效,而且更准确,因为其内部的自注意力机制能为所有字母提供更一致的字距调整。在约 2500 种 Google 字体上的实验结果及其定性和定量分析表明,当所有字体和字母对的平均字母间距约为 115 像素时,整体模型的平均估计误差仅为约 5.3 像素。
引用
@article{arxiv.2402.14313,
title = {Learning to Kern: Set-wise Estimation of Optimal Letter Space},
author = {Kei Nakatsuru and Seiichi Uchida},
journal= {arXiv preprint arXiv:2402.14313},
year = {2024}
}