面向盲人的便携式基于摄像头的产品标签阅读
人机交互
2019-01-18 v2 计算机与社会
摘要
我们提出了一种基于摄像头的辅助文本阅读框架,旨在帮助盲人在日常生活中阅读手持物体上的文本标签和产品包装。为了从杂乱的背景或摄像头视野中的其他周围物体中分离出目标物体,我们最初提出了一种高效且有效的基于运动的方法,通过要求用户抖动物体来定义视频中的感兴趣区域(ROI)。该方案利用基于混合高斯模型的背景减除技术提取运动物体区域。在提取的 ROI 中,进行文本定位和识别以获取文本细节。为了自动聚焦物体 ROI 中的文本区域,我们提出了一种新颖的文本定位算法,通过在 Adaboost 模型中学习笔画方向的梯度特征和边缘像素分布来实现。定位文本区域内的字符随后被二值化,并由现成的光学字符识别软件进行识别。识别出的文本代码被转换为音频输出提供给盲人用户。建议在 ICDAR-2003 和 ICDAR-2011 鲁棒阅读数据集上对提出的文本定位算法性能进行了定量评估。实验结果表明,我们的算法达到了当前的最高水平。概念验证示例也在一个由十名盲人收集的数据集上进行了评估,以检验该方案的有效性。我们探讨了用户界面问题以及算法在从具有复杂背景的不同物体中提取和阅读文本时的鲁棒性。
引用
@article{arxiv.1405.6627,
title = {Portable Camera-Based Product Label Reading For Blind People},
author = {Rajkumar N and Anand M. G and Barathiraja N},
journal= {arXiv preprint arXiv:1405.6627},
year = {2019}
}
备注
This article has been withdrawn by arXiv administrators due to verbatim text overlap from external sources