中文

用于早期现代印刷排版分析的概率生成模型

机器学习 2020-05-05 v1 计算与语言

摘要

我们提出了一种深度且可解释的概率生成模型,用于分析早期现代印刷文档中的字形形状。我们重点关注在存在多种混淆方差源的情况下,将提取的字形图像聚类为底层模板。我们的方法引入了一种神经编辑器模型,该模型首先通过可解释的潜变量从模板参数生成空间扰动等易于理解的印刷现象,然后通过生成一个不可解释的潜向量来修改结果,该潜向量负责墨水变化、抖动、存档过程产生的噪声以及与早期现代印刷相关的其他不可预见现象。关键的是,通过引入输入仅限于观测值与可解释修改模板之间视觉残差的推理网络,我们能够控制和隔离向量值潜变量所捕获的内容。我们表明,在混合字体文档中完全无监督地发现字体的任务上,我们的方法优于僵化的可解释聚类基线(Ocular)和过度灵活的深度生成模型(VAE)。

关键词

引用

@article{arxiv.2005.01646,
  title  = {A Probabilistic Generative Model for Typographical Analysis of Early Modern Printing},
  author = {Kartik Goyal and Chris Dyer and Christopher Warren and Max G'Sell and Taylor Berg-Kirkpatrick},
  journal= {arXiv preprint arXiv:2005.01646},
  year   = {2020}
}

备注

To appear at ACL 2020