中文

让我们增强:一种用于文本图像极端去模糊的深度学习方法

计算机视觉与模式识别 2023-08-08 v2 机器学习 数值分析 数值分析

摘要

本工作提出了一种基于深度学习的新型图像去模糊逆问题处理流程,利用合成数据进行增强与预训练。我们的结果建立在荣获近期赫尔辛基去模糊挑战赛2021的提交方案之上,该挑战的目标是在真实世界数据设置中探索最先进去模糊算法的极限。挑战的任务是去模糊随机文本的失焦图像,从而在下游任务中最大化基于光学字符识别的得分函数。我们解决方案的关键步骤是描述模糊过程的物理前向模型的数据驱动估计。这使得能够生成合成数据流,即时生成真实值与模糊图像对,用于对所提供的少量挑战数据进行了广泛增强。实际的去模糊流程包括径向镜头畸变的近似反演(由估计的前向模型确定)和一个端到端训练的U-Net架构。我们的算法是唯一通过最难挑战级别的算法,实现了超过70%70\%的字符识别准确率。我们的发现与以数据为中心的机器学习范式高度一致,并证明了其在逆问题背景下的有效性。除详细展示我们的方法外,我们还在一系列消融研究中分析了若干设计选择的重要性。我们挑战提交方案的代码可在 https://github.com/theophil-trippe/HDC_TUBerlin_version_1 获取。

关键词

引用

@article{arxiv.2211.10103,
  title  = {Let's Enhance: A Deep Learning Approach to Extreme Deblurring of Text Images},
  author = {Theophil Trippe and Martin Genzel and Jan Macdonald and Maximilian März},
  journal= {arXiv preprint arXiv:2211.10103},
  year   = {2023}
}

备注

This article has been published in a revised form in Inverse Problems and Imaging