用于识别历史涂鸦手写体的胶囊深度神经网络
摘要
我们利用胶囊深度学习神经网络展示了对于刻在乌克兰基辅圣索菲亚大教堂石墙上的历史字母(11—18 世纪)的自动识别。该方法应用于近期为机器学习方法识别与预测而组装并预处理的格拉哥里字母与西里尔字母雕刻图像数据集(CGCL)(https://www.kaggle.com/yoctoman/graffiti-st-sophia-cathedral-kyiv)。CGCL 数据集包含 34 个字母的字形超过 4000 张图像,即便与含有取自不同字体的 10 个字母更优图像的 notMNIST 数据集相比,专家也难以识别这些字形。尽管 CGCL 数据集质量差得多且样本数极少(与 notMNIST 数据集相比),胶囊网络模型仍展现出比先前使用的卷积神经网络(CNN)好得多的结果。即便不进行数据增强,胶囊网络模型的验证准确率(及验证损失)也高于(低于)CNN。接收者操作特征(ROC)的曲线下面积(AUC)值也是胶囊网络模型高于 CNN 模型:无数据增强时为 0.88–0.93(胶囊网络)和 0.50(CNN),无损数据增强时为 0.91–0.95(胶囊网络)和 0.51(CNN),仅在无损数据增强机制下为相似的 0.91–0.93(胶囊网络)和 0.9(CNN)。混淆矩阵方面胶囊网络远优于 CNN 模型,并在所有三种数据增强机制下给出低得多的 I 类(假阳性)和 II 类(假阴性)值。这些结果支持了先前的主张,即类胶囊网络不仅能降低 MNIST 数字数据集上的错误率,也能降低其他 notMNIST 字母数据集以及更复杂的 CGCL 手写涂鸦字母数据集上的错误率。
引用
@article{arxiv.1809.06693,
title = {Capsule Deep Neural Network for Recognition of Historical Graffiti Handwriting},
author = {Nikita Gordienko and Yuriy Kochura and Vlad Taran and Gang Peng and Yuri Gordienko and Sergii Stirenko},
journal= {arXiv preprint arXiv:1809.06693},
year = {2018}
}
备注
6 pages, 8 figures, accepted for 2018 IEEE Ukraine Student, Young Professional and Women in Engineering Congress (UKRSYW), October 2-6, 2018 (Kyiv, Ukraine). arXiv admin note: text overlap with arXiv:1808.10862