面向低成本端到端文本识别的动态低分辨率蒸馏
计算机视觉与模式识别
2022-07-18 v2
摘要
端到端文本识别因其对实际应用的全局优化优势和高可维护性而近期受到广泛关注。然而,输入尺度一直是一个艰难的权衡,因为识别小文本实例通常需要放大整幅图像,这带来了高昂的计算成本。本文中,为解决该问题,我们提出了一种新颖的低成本动态低分辨率蒸馏(DLD)文本识别框架,旨在以不同但可识别的小分辨率推断图像,并在精度与效率之间取得更好平衡。具体而言,我们采用分辨率选择器动态决定不同图像的输入分辨率,其受推理精度与计算成本的双重约束。在文本识别分支上实施了另一种序列知识蒸馏策略,使低分辨率输入获得与高分辨率图像相当的性能。所提方法可端到端优化,并可用于任何现有文本识别框架以提升实用性。在多个文本识别基准上的大量实验表明,该方法极大提升了低分辨率模型的可用性。代码见 https://github.com/hikopensource/DAVAR-Lab-OCR/。
引用
@article{arxiv.2207.06694,
title = {Dynamic Low-Resolution Distillation for Cost-Efficient End-to-End Text Spotting},
author = {Ying Chen and Liang Qiao and Zhanzhan Cheng and Shiliang Pu and Yi Niu and Xi Li},
journal= {arXiv preprint arXiv:2207.06694},
year = {2022}
}
备注
Accept by ECCV2022