TextCaps:基于极小数据集的手写字符识别
计算机视觉与模式识别
2020-08-10 v1 机器学习
摘要
由于缺乏大量带标签的训练数据,许多本地化语言难以从字符识别系统的最新进展中获益。这是因为为此类语言生成大量带标签数据存在困难,且深度学习技术无法从少量训练样本中进行有效学习。我们通过引入一种从现有样本生成新训练样本的技术来解决这一问题,该技术采用反映人类手写中实际变化的现实增强方法,通过向其对应的实例化参数添加随机受控噪声来实现。我们在每类仅有 200 个训练样本的情况下,超越了 EMNIST-letter 数据集上的现有字符识别结果,同时在 EMNIST-balanced、EMNIST-digits 和 MNIST 三个数据集上达到了现有结果。我们还开发了一种有效结合损失函数以改善重建效果的策略。我们的系统适用于缺乏大量带标签训练数据的本地化语言字符识别,甚至也可用于诸如目标识别等其他相关的更一般场景。
引用
@article{arxiv.1904.08095,
title = {TextCaps : Handwritten Character Recognition with Very Small Datasets},
author = {Vinoj Jayasundara and Sandaru Jayasekara and Hirunima Jayasekara and Jathushan Rajasegaran and Suranga Seneviratne and Ranga Rodrigo},
journal= {arXiv preprint arXiv:1904.08095},
year = {2020}
}