American Stories:一个大规模结构化历史美国报纸文本数据集
计算与语言
2023-08-25 v1 计算机视觉与模式识别
综合经济学
经济学
摘要
现有的美国公共领域报纸全文数据集无法识别报纸扫描件中常有的复杂版面,导致数字化内容将文章、标题、图注、广告及其他版面区域中的文本混杂在一起。OCR 质量也可能较低。本研究开发了一种新颖的深度学习流水线,用于从报纸图像中提取完整文章文本,并将其应用于美国国会图书馆公共领域 Chronicling America 收藏中近 2000 万张扫描件。该流水线包括版面检测、可读性分类、定制 OCR,以及跨多个边界框的文章文本关联。为实现高可扩展性,其采用为手机设计的高效架构构建。由此产生的 American Stories 数据集提供了高质量数据,可用于预训练大语言模型(large language model, LLM)以更好地理解历史英语与历史世界知识。该数据集也可加入检索增强语言模型的外部数据库中,使历史信息——从对政治事件的解读到关于人们祖先生活的琐碎细节——更易被广泛获取。此外,结构化文章文本有助于使用基于 transformer 的方法处理热门社会科学应用,如主题分类、复现内容检测及新闻故事聚类。最后,American Stories 提供了一个大规模的银标质量数据集,用于创新多模态版面分析模型及其他多模态应用。
引用
@article{arxiv.2308.12477,
title = {American Stories: A Large-Scale Structured Text Dataset of Historical U.S. Newspapers},
author = {Melissa Dell and Jacob Carlson and Tom Bryan and Emily Silcock and Abhishek Arora and Zejiang Shen and Luca D'Amico-Wong and Quan Le and Pablo Querubin and Leander Heldring},
journal= {arXiv preprint arXiv:2308.12477},
year = {2023}
}