Science Data Lake:整合八个学术来源中2.93亿篇论文的统一开放基础设施
数字图书馆
2026-03-04 v1 数据库
信息检索
社会与信息网络
摘要
学术数据在被划分为不同数据库的碎片化结构中,元数据不统一且缺乏关联链接。我们提出Science Data Lake,一个基于DuckDB和简单Parquet文件构建的本地可部署基础设施,将八个开放数据源——Semantic Scholar、OpenAlex、SciSciNet、Papers with Code、Retraction Watch、Reliance on Science、预印本到已发表论文的映射以及Crossref——通过DOI标准化集成,同时保留源数据级别的模式。该资源包含约960GB的Parquet文件,覆盖约2.93亿篇唯一标识论文,涉及约22个模式和153个SQL视图。我们使用BGE-large句子嵌入进行基于嵌入的本体对齐,将4516个OpenAlex主题映射到13个科学本体中(约130万术语),生成16150个映射,覆盖99.8%的主题(≥0.65阈值),在推荐的≥0.85操作点下F1为0.77,在300对黄金标准评估中 outperform TF-IDF、BM25 和 Jaro-Winkler 等基线方法。我们通过10项自动化检查、跨来源引用一致性分析(两两Pearson相关系数0.76-0.87)以及分层人工标注进行验证。四个案例展示了无法仅凭单个数据库实现的跨来源分析。该资源开源,可在单个驱动器上部署或通过HuggingFace远程查询,并包含适用于大型语言模型(LLM)基于研究代理的结构化文档。
引用
@article{arxiv.2603.03126,
title = {The Science Data Lake: A Unified Open Infrastructure Integrating 293 Million Papers Across Eight Scholarly Sources with Embedding-Based Ontology Alignment},
author = {Jonas Wilinski},
journal= {arXiv preprint arXiv:2603.03126},
year = {2026}
}
备注
18 pages, 8 figures, 7 tables. Dataset DOI: 10.57967/hf/7850. Code: https://github.com/J0nasW/science-datalake