中文

智能手机截屏的文本提取与检索:构建媒体生活数据仓库

信息检索 2018-01-08 v1 计算机视觉与模式识别 数字图书馆 多媒体

摘要

日常生活的体验日益与移动设备使用交织在一起。以秒为尺度的屏幕捕获正被用于行为研究以及实施“即时”健康干预。数字信息的心理广度不断增加,将持续使人们实际观看的屏幕成为关于生活体验的首选乃至必需的数据来源。从数字截屏中高效且有效地进行信息提取与检索,是成功利用屏幕数据的关键前提。本文展示了我们所采用的实验流程,以:(i) 对独特的屏幕捕获集合进行预处理,(ii) 提取图像中嵌入的非结构化文本,(iii) 基于结构化模式组织图像文本与元数据,(iv) 对所得文档集合建立索引,以及 (v) 通过专用的垂直搜索引擎应用实现图像检索。所采用的流程集成了不同的开源库,用于传统图像处理、光学字符识别(OCR)与图像检索。我们的目标是评估最先进的方法能否及如何应用于这一新颖数据集。我们展示了如何将基于 OpenCV 的预处理模块与基于长短期记忆(LSTM)的 Tesseract OCR 版本相结合,在无需专门训练的情况下,使提取文本的字符级准确率达到 74%。此外,我们将处理后的数据仓库作为专用图像检索系统的基线,供行为科学与预防科学家即时使用和应用。我们讨论了截屏图像情形下特有的文本信息提取与检索问题,并提出了重要的未来工作方向。

关键词

引用

@article{arxiv.1801.01316,
  title  = {Text Extraction and Retrieval from Smartphone Screenshots: Building a Repository for Life in Media},
  author = {Agnese Chiatti and Mu Jung Cho and Anupriya Gagneja and Xiao Yang and Miriam Brinberg and Katie Roehrick and Sagnik Ray Choudhury and Nilam Ram and Byron Reeves and C. Lee Giles},
  journal= {arXiv preprint arXiv:1801.01316},
  year   = {2018}
}