中文

误差减半:用于文档图像分类的极深CNN与先进训练策略研究

计算机视觉与模式识别 2018-03-28 v1

摘要

我们对近期深度学习架构、算法和策略在文档图像分类任务上进行了详尽研究,最终将误差降低一半以上。现有方法(如DeepDocClassifier)应用标准卷积网络架构并结合来自目标识别领域的迁移学习。本文的贡献有三方面:首先,研究了近期引入的极深神经网络架构(GoogLeNet、VGG、ResNet)使用迁移学习(从真实图像)。其次,提出了来自大量文档图像集(即400,000份文档)的迁移学习。第三,分析了训练数据量(文档图像)及其他参数对分类能力的影响。我们使用两个数据集:Tobacco-3482和大规模RVL-CDIP数据集。我们在Tobacco-3482数据集上达到了91.13%的准确率,而早期方法仅达到77.6%。因此,实现了超过60%的相对误差降低。对于大规模数据集RVL-CDIP,达到了90.97%的准确率,对应于11.5%的相对误差降低。

关键词

引用

@article{arxiv.1704.03557,
  title  = {Cutting the Error by Half: Investigation of Very Deep CNN and Advanced Training Strategies for Document Image Classification},
  author = {Muhammad Zeshan Afzal and Andreas Kölsch and Sheraz Ahmed and Marcus Liwicki},
  journal= {arXiv preprint arXiv:1704.03557},
  year   = {2018}
}