利用深度神经网络知识蒸馏进行多文字识别
计算机视觉与模式识别
2021-02-23 v1
摘要
多语言文字识别是一项困难任务,包含自然场景文本图像中不同语言及复杂背景。根据当前研究现状,深度神经网络被用作教师模型,利用其预测来训练更小的学生网络。该过程称为暗知识迁移(dark knowledge transfer)。它在许多领域相当成功,其最终结果是通过简单架构直接训练学生网络无法达到的。本文中,我们探索暗知识迁移方法,使用长短期记忆(LSTM)和基于 CNN 的辅助模型以及多种深度神经网络作为教师模型,以简单的基于 CNN 的学生网络,在自然场景文本图像多文字识别这一领域中进行探索。我们探究不同教师模型的性能及其向学生网络迁移知识的能力。尽管学生网络规模有限,我们的方法在知名文字识别数据集 CVSI-2015 上取得了满意结果。
引用
@article{arxiv.2102.10335,
title = {Exploring Knowledge Distillation of a Deep Neural Network for Multi-Script identification},
author = {Shuvayan Ghosh Dastidar and Kalpita Dutta and Nibaran Das and Mahantapas Kundu and Mita Nasipuri},
journal= {arXiv preprint arXiv:2102.10335},
year = {2021}
}
备注
14 pages, 6 figures, 7 tables