中文

基于传统方法与两种深度学习方法在大型历史文档集上词图像分类的大规模实地测试

计算机视觉与模式识别 2019-04-19 v1 机器学习 机器学习

摘要

本技术报告描述了一项在超过300种多样化手写历史手稿的极大型集合上进行的词图像分类实用实地测试,其中包含160万张唯一标注图像以及超过1100万张用于测试的图像。结果表明,若干深度学习测试完全失败(平均准确率83%)。在采用独热编码进行分类且输出单元(词典词)超过1000个的测试中,即便预终层(即倒数第二层)规模适中(150单元),性能也急剧降至近乎零准确率。一种传统特征方法(BOVW)在不同类别数与训练样本数下表现稳定(平均准确率87%)。额外使用 Inception V3 网络预终层输出的最近均值法,对每本书仅得出平庸结果(平均准确率49%),但对高类别数不敏感。值得注意的是,该实验得以进行仅基于以传统方法获取的标注,而传统方法从每类仅一张标注图像即可工作。预计失败深度学习测试的性能可被修复,但只能基于对网络架构与超参数的手工调整。若不计入失败的疑难书籍,端到端 CNN 训练可达约95%准确率。该平均值受大量中文字符子集主导,其他文字样式的性能较低。

关键词

引用

@article{arxiv.1904.08421,
  title  = {A large-scale field test on word-image classification in large historical document collections using a traditional and two deep-learning methods},
  author = {Lambert Schomaker},
  journal= {arXiv preprint arXiv:1904.08421},
  year   = {2019}
}

备注

Field test of a large operational image search system, comparing BOVW and end-to-end CNN