数字化旧报纸文章提取的逻辑分割
信息检索
2012-10-04 v1 计算机视觉与模式识别
数字图书馆
摘要
报纸是由新闻项目和信息性文章组成的文档。它们并非旨在按顺序阅读:读者可以随意挑选项目。大多数数字化报纸档案忽略了这一结构特性,仅提供按期或至多按页的内容访问。我们构建了一个数字化工作流程,可从图像中自动提取报纸文章,从而实现文章级别的信息索引和检索。我们的后端系统提取页面的逻辑结构以生成信息单元:即文章。每种图像通过基于机器学习的方法在像素级别进行标记,然后通过检测水平和垂直分隔符、标题和文本行等结构化实体,自下而上构建页面逻辑结构。该逻辑结构存储在 METS 包装器中,并与系统生成的包含 OCR 文本的 ALTO 文件相关联。我们的前端系统提供图像的高清可视化、文本索引和检索功能,支持文章级别的搜索和阅读。文章转录可以进行协作校正,从而改善索引效果。我们目前正在法国最古老的地方报纸之一《鲁昂日报》(Journal de Rouen) 的档案上测试我们的系统。这 250 年的出版量共计 300,000 页,图像质量和版面复杂度差异极大。1808 测试年份可在 plair.univ-rouen.fr 查阅。
引用
@article{arxiv.1210.0999,
title = {Logical segmentation for article extraction in digitized old newspapers},
author = {Thomas Palfray and David Hébert and Stéphane Nicolas and Pierrick Tranouez and Thierry Paquet},
journal= {arXiv preprint arXiv:1210.0999},
year = {2012}
}
备注
ACM Document Engineering, France (2012)