中文

来自开放获取科学出版物的已分类段落的多语言数据集

计算与语言 2025-10-28 v1 数字图书馆

摘要

我们提出了一个包含 833k 个段落的数据集,这些段落从 CC-BY 许可的科学出版物中提取,分为四个类别:致谢、数据提及、软件/代码提及和临床试验提及。这些段落主要为英文和法语,还包括其他欧洲语言。每个段落都带有语言识别(使用 fastText)和科学领域(来自 OpenAlex)的注释。该数据集源自法国开放科学监控语料库,经 GROBID 处理后,可用于训练文本分类模型和开发科学文献挖掘的命名实体识别系统。该数据集在 HuggingFace 上公开可用:https://doi.org/10.57967/hf/6679,使用 CC-BY 许可证发布。

关键词

引用

@article{arxiv.2510.21762,
  title  = {A Multi-lingual Dataset of Classified Paragraphs from Open Access Scientific Publications},
  author = {Eric Jeangirard},
  journal= {arXiv preprint arXiv:2510.21762},
  year   = {2025}
}