基于混合 CNN-ViT 的运动模糊场景文本恢复框架
计算机视觉与模式识别
2025-11-11 v1 人工智能
摘要
场景文本图像中的运动模糊严重影响可读性,阻碍了自动驾驶、文档数字化和视觉信息检索等计算机视觉任务的可靠性。传统去模糊方法往往难以处理空间可变模糊,且在建模恢复文本清晰度所需的长程依赖方面不足。为克服这些限制,我们提出一种混合深度学习框架,结合卷积神经网络 (CNN) 和视觉转换器 (ViT),既利用局部特征提取,又进行全局上下文推理。该架构采用 CNN 基于编码器-解码器结构保留结构细节,同时通过自注意力机制的转换器模块增强全局感知。训练在从 TextOCR 中提取的精选数据集上进行,数据集包含与人工合成的多尺寸、多方向运动模糊核生成的锐利场景文本样本与其模糊版本的配对。模型优化采用包含均值绝对误差 (MAE)、平方误差 (MSE)、感知相似性和结构相似性 (SSIM) 的复合损失。定量评估显示,所提方法在 PSNR 上达到 32.20 dB,在 SSIM 上达到 0.934,同时参数仅 283 万,平均推理时间为 61 毫秒。这些结果凸显了 CNN-ViT 混合设计在有效性和计算效率方面的优势,为实际应用中的运动模糊场景文本恢复奠定了基础。
引用
@article{arxiv.2511.06087,
title = {Hybrid CNN-ViT Framework for Motion-Blurred Scene Text Restoration},
author = {Umar Rashid and Muhammad Arslan Arshad and Ghulam Ahmad and Muhammad Zeeshan Anjum and Rizwan Khan and Muhammad Akmal},
journal= {arXiv preprint arXiv:2511.06087},
year = {2025}
}