中文

基于视觉原型的手写文本生成

计算机视觉与模式识别 2023-03-28 v1

摘要

以特定书写者风格生成手写文本的合成图像是一项具有挑战性的任务,尤其是在面对未见风格与新词时,而当后者包含训练期间极少遇到的字符时更甚。尽管模仿书写者风格近期已由生成模型解决,但对罕见字符的泛化却被忽视。在本工作中,我们设计了一个基于 Transformer 的少样本风格化手写文本生成模型,并致力于获得文本与风格兼具鲁棒性与信息性的表示。特别地,我们提出一种将文本内容表示为稠密向量序列的新颖表示,这些向量提取自以标准 GNU Unifont 字形书写的符号图像,可视为其视觉原型。该策略更适于生成那些尽管训练时极少出现、却可能与常见字符共享视觉细节的字符。至于风格,我们通过在大合成数据集上的特定预训练获得未见书写者书法的鲁棒表示。定量与定性结果表明,相较于依赖字符独立 one-hot 编码的现有方法,我们的方案能更忠实地生成未见风格且含罕见字符的单词。

关键词

引用

@article{arxiv.2303.15269,
  title  = {Handwritten Text Generation from Visual Archetypes},
  author = {Vittorio Pippi and Silvia Cascianelli and Rita Cucchiara},
  journal= {arXiv preprint arXiv:2303.15269},
  year   = {2023}
}

备注

Accepted at CVPR2023