边缘化可部署 OCR 模型视野: billboard 可见性分析概览
计算机视觉与模式识别
2025-07-17 v1 人工智能
摘要
户外广告仍是现代营销的关键媒介,但在现实条件下准确验证 billboard 文本可见性仍富有挑战。传统的光学字符识别(OCR)管道在裁剪文本识别方面表现良好,但常在复杂户外场景、不同字体和天气引起的视觉噪声下表现不佳。最近,多模态视觉-语言模型(VLM)作为新的替代方案涌现,提供无显式检测步骤的端到端场景理解能力。本工作系统性地对标代表性VLM——包括 Qwen 2.5 VL 3B、InternVL3 和 SmolVLM2——与紧凑型CNN-based OCR 基线(PaddleOCRv4)进行基准测试,使用两个公共数据集(ICDAR 2015 和 SVT),并加入合成天气扰动以模拟真实降解。我们的结果表明,虽然所选VLM在整体场景推理方面表现突出,但轻量级CNN管道在计算成本更低的情况下仍能为裁剪文本取得竞争性准确率——这对于边缘部署尤为重要。为促进未来研究,我们公开了我们的天气增强基准和评估代码。
引用
@article{arxiv.2507.11730,
title = {Seeing the Signs: A Survey of Edge-Deployable OCR Models for Billboard Visibility Analysis},
author = {Maciej Szankin and Vidhyananth Venkatasamy and Lihang Ying},
journal= {arXiv preprint arXiv:2507.11730},
year = {2025}
}