中文

FONTNET:端侧字体理解与预测流水线

计算机视觉与模式识别 2021-03-31 v1 机器学习

摘要

字体是最基本且核心的设计概念之一。诸多用例可受益于对字体的深入理解,例如文本定制能够在保持字体属性(如风格、颜色、大小)的同时更改图像中的文本。当前,文本识别方案可基于换行或分段来分组已识别文本,若已知字体属性,则可基于上下文以有意义的方式合并多个文本块。本文中,我们提出两个引擎:字体检测引擎,用于识别图像中文本的字体风格、颜色和大小属性;以及字体预测引擎,用于为查询字体预测相似字体。本文的主要贡献有三方面:第一,我们开发了用于识别图像中文本字体风格的新型 CNN 架构。第二,我们设计了一种为给定查询字体预测相似字体的新算法。第三,我们已优化并将整个引擎部署于端侧(On-Device),从而确保隐私并提升即时消息等实时应用中的延迟。两个引擎的最坏情况端侧推理时间为 30ms,模型大小为 4.5MB。

关键词

引用

@article{arxiv.2103.16150,
  title  = {FONTNET: On-Device Font Understanding and Prediction Pipeline},
  author = {Rakshith S and Rishabh Khurana and Vibhav Agarwal and Jayesh Rajkumar Vachhani and Guggilla Bhanodai},
  journal= {arXiv preprint arXiv:2103.16150},
  year   = {2021}
}

备注

Accepted for publication in IEEE ICASSP 2021: 46th IEEE International Conference on Acoustics, Speech, & Signal Processing