中文

孟加拉手写数字识别中手工特征提取技术的经典方法

计算机视觉与模式识别 2022-01-26 v1 机器学习

摘要

孟加拉手写数字识别是孟加拉语 OCR 发展中的重要一步。然而,孟加拉数字复杂的形状、结构上的相似性和独特的组合风格使其相对难以区分。因此,在本文中,我们基于三种手工特征提取技术:方向梯度直方图 (HOG)、局部二值模式 (LBP) 和 Gabor 滤波器,在四个公开可用的孟加拉手写数字数据集:NumtaDB、CMARTdb、Ekush 和 BDRW 上,对四种严格的分类器进行了基准测试:K-近邻 (KNN)、支持向量机 (SVM)、随机森林 (RF) 和梯度提升决策树 (GBDT)。这里,手工特征提取方法用于从数据集图像中提取特征,随后利用这些特征训练机器学习分类器以识别孟加拉手写数字。我们进一步微调了分类算法的超参数,以便从这些算法中获得最佳的孟加拉手写数字识别性能,并且在我们采用的所有模型中,HOG 特征与 SVM 模型相结合 (HOG+SVM) 在所有数据集上均取得了最佳性能指标。HOG+SVM 方法在 NumtaDB、CMARTdb、Ekush 和 BDRW 数据集上的识别准确率分别达到 93.32%、98.08%、95.68% 和 89.68%,同时我们将该模型性能与近期 SOTA 方法进行了比较。

关键词

引用

@article{arxiv.2201.10102,
  title  = {A Classical Approach to Handcrafted Feature Extraction Techniques for Bangla Handwritten Digit Recognition},
  author = {Md. Ferdous Wahid and Md. Fahim Shahriar and Md. Shohanur Islam Sobuj},
  journal= {arXiv preprint arXiv:2201.10102},
  year   = {2022}
}