中文

基于语义引导的高效场景文本图像超分辨率

计算机视觉与模式识别 2024-03-21 v1

摘要

场景文本图像超分辨率显著提高了场景文本识别的准确性。然而,许多现有方法强调性能而非效率,忽略了部署场景中对轻量级解决方案的实际需求。针对这些问题,我们的工作提出了一个名为SGENet的高效框架,以促进在资源受限平台上的部署。SGENet包含两个分支:超分辨率分支和语义引导分支。我们应用一个轻量级的预训练识别器作为语义提取器,以增强对文本信息的理解。同时,我们设计了视觉-语义对齐模块,以实现图像特征和语义之间的双向对齐,从而生成高质量的先验引导。我们在基准数据集上进行了大量实验,所提出的SGENet以更少的计算成本实现了优异的性能。代码可在 https://github.com/SijieLiu518/SGENet 获取。

关键词

引用

@article{arxiv.2403.13330,
  title  = {Efficient scene text image super-resolution with semantic guidance},
  author = {LeoWu TomyEnrique and Xiangcheng Du and Kangliang Liu and Han Yuan and Zhao Zhou and Cheng Jin},
  journal= {arXiv preprint arXiv:2403.13330},
  year   = {2024}
}