用于孟加拉语手写字符与数字识别的小样本学习方法性能分析
计算机视觉与模式识别
2025-06-03 v1
摘要
本研究调查了小样本学习(FSL)方法在有限标注数据下识别孟加拉语手写字符和数字的性能。它展示了这些方法在结构复杂精细且数据集稀缺是常见挑战的文字上的适用性。鉴于孟加拉语文字的复杂性,我们假设在这些字符上表现良好的模型能够有效泛化到具有相似或更低结构复杂性的语言。为此,我们引入了 SynergiProtoNet,这是一种旨在提高手写字符和数字识别准确率的混合网络。该模型将先进的聚类技术与鲁棒的嵌入框架相结合,以捕获细粒度细节和上下文细微差别。它利用原型学习框架内的多级(高级和低级)特征提取。我们在多种评估设置下,包括单语种数据集内评估、单语种数据集间评估、跨语种迁移和拆分数字测试,将 SynergiProtoNet 与几种最先进的小样本学习模型(BD-CSPN、Prototypical Network、Relation Network、Matching Network 和 SimpleShot)进行了严格基准测试。实验结果表明,SynergiProtoNet 始终优于现有方法,为手写字符和数字识别的小样本学习确立了新基准。代码可在 GitHub 获取:https://github.com/MehediAhamed/SynergiProtoNet。
引用
@article{arxiv.2506.00447,
title = {Performance Analysis of Few-Shot Learning Approaches for Bangla Handwritten Character and Digit Recognition},
author = {Mehedi Ahamed and Radib Bin Kabir and Tawsif Tashwar Dipto and Mueeze Al Mushabbir and Sabbir Ahmed and Md. Hasanul Kabir},
journal= {arXiv preprint arXiv:2506.00447},
year = {2025}
}