评估助听技术下 OCR 性能:行走速度、摄像机位置与摄像机类型的影响
计算机视觉与模式识别
2026-03-24 v2
摘要
光学字符识别(OCR)是将打印或手写文本转换为机器可读格式的过程,在为视力受损者提供辅助技术时广泛应用。然而大多数评估依赖不反映移动使用挑战的静态数据集。本研究系统评估了 OCR 在静态和动态条件下的性能。静态测试测量了在 1-7 米距离和水平 0-75 度视角下的检测范围。动态测试检验了通过改变行走速度从慢速(0.8 米/秒)到非常快(1.8 米/秒)的运动影响,并比较了三种摄像机安装位置:头戴式、肩部式和手持式。我们评估了智能手机和智能眼镜,分别使用手机的主摄像头和超广角摄像头。对四个 OCR 引擎进行基准测试,以评估在不同距离和视角下的准确性:Google Vision、PaddleOCR 3.0、EasyOCR 和 Tesseract。随后使用 PaddleOCR 3.0 评估动态行走条件下的 OCR 性能。以字符级计算准确率,采用 Levenshtein 比率与手动定义的 ground truth 进行比较。结果显示,随着行走速度增加和视角扩大,识别准确率下降。Google Vision 实现了最高的总体准确率,PaddleOCR 紧随其后作为最强的开源替代方案。在各种设备中,手机的主摄像头实现了最高的准确率,肩部安装位置在身体位置中平均表现最佳;然而,肩部、头部和手持位置之间的差异并不显著。
引用
@article{arxiv.2602.02223,
title = {Evaluating OCR Performance for Assistive Technology: Effects of Walking Speed, Camera Placement, and Camera Type},
author = {Junchi Feng and Nikhil Ballem and Mahya Beheshti and Giles Hamilton-Fletcher and Todd Hudson and Maurizio Porfiri and William H. Seiple and John-Ross Rizzo},
journal= {arXiv preprint arXiv:2602.02223},
year = {2026}
}