中文

面向文档扫描的任务驱动实景超分辨率

计算机视觉与模式识别 2025-06-10 v1

摘要

单图像超分辨率指的是从单个低分辨率观测值重建高分辨率图像。尽管最近的深度学习方法在模拟数据集上取得显著成功——这些数据集通过对高分辨率图像进行退化和下采样获得——但它们经常无法在现实场景中普遍化,例如文档扫描,这些场景受到复杂退化和语义可变性的影响。在本研究中,我们引入了一个面向任务的多任务学习框架,用于针对光学字符识别任务训练超分辨率网络。我们提出要纳入源自高级视觉任务的辅助损失函数,包括使用连接主义文本提案网络进行文本检测、通过卷积循环神经网络进行文本识别、使用Key.Net进行关键点局部化以及保持色调一致性。为了平衡这些多样化的目标,我们采用动态权重平均机制,该机制根据每个损失项的收敛行为自适应调整每个损失项的相对重要性。我们在SRResNet架构上进行验证,该架构是单图像超分辨率的一种成熟技术。在模拟数据集和真实世界扫描文档数据集上的实验评估表明,所提出的方法在保持整体图像保真度的同时,提高了文本检测的交并比。这些发现凸显了多目标优化在超分辨率模型中桥接模拟训练 regime 与实际部署于现实场景之间的价值。

关键词

引用

@article{arxiv.2506.06953,
  title  = {Task-driven real-world super-resolution of document scans},
  author = {Maciej Zyrek and Tomasz Tarasiewicz and Jakub Sadel and Aleksandra Krzywon and Michal Kawulok},
  journal= {arXiv preprint arXiv:2506.06953},
  year   = {2025}
}