TeLCoS:基于文字聚类脚本的端侧文本定位
计算机视觉与模式识别
2021-04-22 v2 人工智能
摘要
近年来,在资源受限环境下的文本定位研究中,深度神经网络得到了广泛应用。低内存移动设备上的场景文本定位与识别具有广泛的应用,包括内容提取、图像分类以及基于关键词的图像检索。对于多语言定位文本的识别,OCR系统需要预先知道每个文本实例的书写系统(script)。这使得文字书写系统识别成为文本识别中必不可少的一步。大多数现有方法将文本定位、书写系统识别和文本识别视为三个独立的任务,这使得书写系统识别成为识别流程中的额外开销。为减少该开销,我们提出TeLCoS:基于文字聚类脚本的端侧文本定位,一种多任务双分支轻量级CNN网络,可同时在设备上实时进行文本定位与高层级书写系统聚类。该网络通过对定位网络的一次前向传播对部分常用书写系统进行分组与识别,大幅减少了调用独立书写系统识别模块的次数。我们还引入了一种基于结构相似性的通道剪枝机制,构建了仅含1.15M参数的高效网络。在基准数据集上的实验表明,我们的方法达到了最先进的性能,在整个流程于Exynos 990芯片设备上执行延迟为60 ms。
引用
@article{arxiv.2104.08045,
title = {TeLCoS: OnDevice Text Localization with Clustering of Script},
author = {Rachit S Munjal and Manoj Goyal and Rutika Moharir and Sukumar Moharana},
journal= {arXiv preprint arXiv:2104.08045},
year = {2021}
}
备注
Accepted for publication in IJCNN 2021