端侧文本图像超分辨率
计算机视觉与模式识别
2022-01-03 v1
摘要
近年来,随着深度卷积神经网络的进步,超分辨率(SR)研究取得了重大发展。在设备端存在从场景文本图像乃至文档图像中提取信息的需要,其中大多为低分辨率(LR)图像。因此,SR 成为必不可少的预处理步骤,因为智能手机中传统采用的双三次上采样(Bicubic Upsampling)在 LR 图像上表现不佳。为了使用户更好地掌控自身隐私,并通过减少云计算开销与数小时的 GPU 使用来降低碳足迹,在边缘设备上运行 SR 模型在当下已成为一种必然。在智能手机等资源受限平台上运行并优化模型面临诸多挑战。本文提出一种新颖的深度神经网络,可重建更清晰的字符边缘,从而提升 OCR 置信度。所提架构不仅在多个基准数据集上相较双三次上采样取得显著的 PSNR 提升,且平均每张图像推理时间仅为 11.7 ms。我们在 Text330 数据集上超越了当前最优(state-of-the-art)。在 ICDAR 2015 TextSR 数据集上,我们亦取得 75.89% 的 OCR 准确率,而该数据集真值(ground truth)准确率为 78.10%。
引用
@article{arxiv.2011.10251,
title = {On-Device Text Image Super Resolution},
author = {Dhruval Jain and Arun D Prabhu and Gopi Ramena and Manoj Goyal and Debi Prasanna Mohanty and Sukumar Moharana and Naresh Purre},
journal= {arXiv preprint arXiv:2011.10251},
year = {2022}
}
备注
Accepted to the International Conference on Pattern Recognition(ICPR), 2020