Institutional Books 1.0:来自哈佛图书馆收藏的2420亿token数据集,经校勘优化可用
计算与语言
2025-06-11 v1 数字图书馆
摘要
大型语言模型(LLM)依赖数据来了解世界,以产生有意义的相关性和预测。因此,所使用的数据的性质、规模、质量和多样性,直接影响其质量。LLM的快速发展与应用,推动了各类质量参差不齐的模型的出现,凸显了公开可得高质量训练数据的稀缺,并暴露了亟需将数据治理建立在可持续实践与清晰来源链基础上的需求。为此,本技术报告介绍了Institutional Books 1.0,即一大批来自Google Books项目中哈佛图书馆数字化的公共领域书籍。我们与哈佛图书馆合作,将这些卷册提取、分析并加工为一个广泛记录的数据集,包含历史文献。该分析覆盖了该项目扫描哈佛图书馆收藏的所有卷册,最初涵盖1,075,899卷书籍,采用250多种语言,总计约2500亿个token。在本次初始发布中,已公开OCR提取的文本(原始及后处理版本)以及图书馆学信息、来源信息和生成信息的元数据,涉及983,004卷书籍,或2420亿个token,确认其为公共领域。本报告描述了本项目的目标与方法,以及我们所执行的各种分析,以服务于使该历史收藏更易于人类与机器过滤、阅读与使用。
引用
@article{arxiv.2506.08300,
title = {Institutional Books 1.0: A 242B token dataset from Harvard Library's collections, refined for accuracy and usability},
author = {Matteo Cargnelutti and Catherine Brobston and John Hess and Jack Cushman and Kristi Mukk and Aristana Scourtas and Kyle Courtney and Greg Leppert and Amanda Watson and Martha Whitehead and Jonathan Zittrain},
journal= {arXiv preprint arXiv:2506.08300},
year = {2025}
}