通过并行系统提升文档图像分类精度与速度
计算机视觉与模式识别
2020-06-17 v1 分布式、并行与集群计算
机器学习
摘要
本文展示了一项研究,表明在文档分类任务中,EfficientNet 模型相较于更重的卷积神经网络(CNNs)具有优势,而文档分类是机构数字化过程中的关键问题。我们在 RVL-CDIP 数据集上表明,可以用轻得多的模型改进先前的结果,并展示其在更小的领域内数据集(如 Tobacco3482)上的迁移学习能力。此外,我们提出了一种集成流水线,能够通过将图像模型预测与 BERT 模型在 OCR 提取文本上生成的预测相结合,来提升仅图像输入的效果。我们还表明,可以有效增大批量大小而不损害其精度,从而可通过在多块 GPU 上并行化来加速训练过程,减少所需的计算时间。最后,我们揭示了 PyTorch 与 Tensorflow 深度学习框架之间的训练性能差异。
引用
@article{arxiv.2006.09141,
title = {Improving accuracy and speeding up Document Image Classification through parallel systems},
author = {Javier Ferrando and Juan Luis Dominguez and Jordi Torres and Raul Garcia and David Garcia and Daniel Garrido and Jordi Cortada and Mateo Valero},
journal= {arXiv preprint arXiv:2006.09141},
year = {2020}
}