中文

面向历史 graffiti 自动识别的开源数据集与机器学习技术

机器学习 2018-12-06 v1 计算机视觉与模式识别 计算机与社会 机器学习

摘要

本文提出用于自动识别刻于乌克兰基辅圣索菲亚大教堂石墙上历史字母(XI–XVIII世纪)的机器学习技术。我们收集并预处理了一个新的此类格拉哥里字母与西里尔字母(CGCL)图像数据集,以供机器学习方法识别与预测。该数据集包含34类字母的逾4000幅图像。对CGCL与notMNIST数据集的探索性数据分析表明,由于石雕字母相较于手写字母的表征更差,难以通过降维方法(例如t分布随机邻域嵌入(tSNE))区分。我们应用了多项逻辑回归(MLR)与二维卷积神经网络(CNN)模型。MLR模型在notMNIST与CGCL上的受试者工作特征(ROC)曲线下面积(AUC)分别不低于0.92与0.60。在高损数据增强条件下,CNN模型对notMNIST与CGCL的AUC值均接近0.99(尽管CGCL相较notMNIST规模与质量小得多)。CGCL数据集已作为开源资源发布供数据科学界使用。

关键词

引用

@article{arxiv.1808.10862,
  title  = {Open Source Dataset and Machine Learning Techniques for Automatic Recognition of Historical Graffiti},
  author = {Nikita Gordienko and Peng Gang and Yuri Gordienko and Wei Zeng and Oleg Alienin and Oleksandr Rokovyi and Sergii Stirenko},
  journal= {arXiv preprint arXiv:1808.10862},
  year   = {2018}
}

备注

11 pages, 9 figures, accepted for 25th International Conference on Neural Information Processing (ICONIP 2018), 14-16 December, 2018 (Siem Reap, Cambodia)