基于语义引导的高效场景文本图像超分辨率
计算机视觉与模式识别
2024-03-21 v1
摘要
场景文本图像超分辨率显著提高了场景文本识别的准确性。然而,许多现有方法强调性能而非效率,忽略了部署场景中对轻量级解决方案的实际需求。针对这些问题,我们的工作提出了一个名为SGENet的高效框架,以促进在资源受限平台上的部署。SGENet包含两个分支:超分辨率分支和语义引导分支。我们应用一个轻量级的预训练识别器作为语义提取器,以增强对文本信息的理解。同时,我们设计了视觉-语义对齐模块,以实现图像特征和语义之间的双向对齐,从而生成高质量的先验引导。我们在基准数据集上进行了大量实验,所提出的SGENet以更少的计算成本实现了优异的性能。代码可在 https://github.com/SijieLiu518/SGENet 获取。
关键词
引用
@article{arxiv.2403.13330,
title = {Efficient scene text image super-resolution with semantic guidance},
author = {LeoWu TomyEnrique and Xiangcheng Du and Kangliang Liu and Han Yuan and Zhao Zhou and Cheng Jin},
journal= {arXiv preprint arXiv:2403.13330},
year = {2024}
}