中文

Lit2Vec:从S2ORC构建受法律筛选的化学语料库的可复现工作流程

数据库 2026-04-15 v1 人工智能

摘要

我们提出Lit2Vec,这是一个从Semantic Scholar开放研究语料库(S2ORC)中构建和验证化学语料库的可复现工作流程,采用保守的基于元数据的许可证筛选。通过该工作流程,我们组建了一个内部研究语料库,包含582,683篇化学专用全文研究文章,包含结构化全文、面向token的段落块、使用intfloat/e5-large-v2模型生成的段落级嵌入,以及包括摘要和许可证信息的记录级元数据。为支持下游检索和文本挖掘用例,还对语料库的合格子集进行了补充,添加了机器生成的简要摘要和跨18个化学领域的多标签子领域标注。许可证使用来自Unpaywall、OpenAlex和Crossref的元数据进行筛选,所得语料库在模式符合性、嵌入可复现性、文本质量和元数据完整性方面进行了技术验证。本工作的主要贡献是语料库构建与验证的可复现工作流程,以及其相关的模式和可复现性资源。所发布的材料包括代码、重建工作流程、模式、元数据/源头信息artifact以及验证输出,足以使用固定的公共上游资源复现语料库。公开 redistribution of source-derived text和广泛的文本派生表征不在一般发布范围内。研究人员可以通过使用所发布的管道配合公共可用的上游数据集和元数据服务来复现工作流程。

关键词

引用

@article{arxiv.2604.12498,
  title  = {Lit2Vec: A Reproducible Workflow for Building a Legally Screened Chemistry Corpus from S2ORC for Downstream Retrieval and Text Mining},
  author = {Mahmoud Amiri and Jamile Mohammad Jafari and Sara Mostafapour and Thomas Bocklitz},
  journal= {arXiv preprint arXiv:2604.12498},
  year   = {2026}
}