中文

基于少样本学习的离线阿姆哈拉语手写字符识别

计算机视觉与模式识别 2022-10-04 v1

摘要

少样本学习是机器学习中一个重要但具挑战性的问题,旨在仅从较少的标注训练样本中学习。由于深度学习需要海量标注数据集(这在实际中不可行),它已成为一个活跃的研究领域。从少量样本学习也是迈向类人学习的重要尝试。少样本学习已在机器学习的不同应用领域中展现出良好前景,尤其在图像分类方面。由于它是较新的技术,多数研究者聚焦于通过仅关注Mini-ImageNet和Omniglot等常见图像数据集来理解和解决与其概念相关的问题。少样本学习也为解决阿姆哈拉语等低资源语言问题提供了机会。本研究探讨了基于少样本学习的离线阿姆哈拉语手写字符识别。特别地,作为基线的原型网络(一种流行且简洁的少样本学习方法)被予以实现。利用阿姆哈拉字母具有行向与列向相似性的特点,提出了一种新颖的训练episode增广方式。实验结果表明,所提方法优于基线方法。本研究首次将少样本学习应用于阿姆哈拉字符。更重要的是,研究结果为审视少样本学习中训练episode的影响开辟了新途径,而这是亟需探索的重要问题之一。本研究使用的数据集由母语为阿姆哈拉语者通过作为本研究一部分开发的Android应用收集。

关键词

引用

@article{arxiv.2210.00275,
  title  = {Offline Handwritten Amharic Character Recognition Using Few-shot Learning},
  author = {Mesay Samuel and Lars Schmidt-Thieme and DP Sharma and Abiot Sinamo and Abey Bruck},
  journal= {arXiv preprint arXiv:2210.00275},
  year   = {2022}
}

备注

PanAfriCon AI 2022 virtual conference paper