基于多任务学习的多文字手写数字识别
计算机视觉与模式识别
2022-10-04 v1 机器学习
摘要
手写数字识别是机器学习中研究广泛的领域之一。除在 MNIST 数据集上更广泛的研究外,还有许多关于各种文字识别的研究工作。然而,鼓励鲁棒且多用途系统发展的多文字数字识别并不常见。此外,开展多文字数字识别可实现多任务学习,例如将文字分类视为一项相关任务。显然,多任务学习通过利用相关任务中所含信息经由归纳迁移提升模型性能。因此,本研究将探讨使用多任务学习的多文字手写数字识别。作为展示该问题解决方案的具体案例,还将实验阿姆哈拉语手写字符识别。研究了包括拉丁、阿拉伯与卡纳达三种文字的手写数字,以表明经重构个体任务的多任务模型展现出有前景的结果。本研究中提出一种利用个体任务预测的新方法,以帮助分类性能并正则化不同损失以服务于主任务。该发现优于基线与传统多任务学习模型。更重要的是,它避免了对任务不同损失进行加权的需要,而这是多任务学习中的挑战之一。
引用
@article{arxiv.2106.08267,
title = {Multi-script Handwritten Digit Recognition Using Multi-task Learning},
author = {Mesay Samuel Gondere and Lars Schmidt-Thieme and Durga Prasad Sharma and Randolf Scholz},
journal= {arXiv preprint arXiv:2106.08267},
year = {2022}
}