Biomed-Enriched: 用于预训练与提取罕见与隐藏内容的由 LLM 丰富的生物医学数据集
计算与语言
2025-06-26 v1 机器学习
摘要
我们介绍 Biomed-Enriched,这是一个来自 PubMed 的生物医学文本数据集,经由两阶段标注过程构建。第一阶段,大语言模型为来自 PubMed 科学文章的 40 万段文字标注其类型(综述、研究、临床病例、其他)、领域(临床、生物医学、其他)及教育质量。教育质量评分(1-5 分)估计该段文字对大学生水平学习的有用性。随后,这些标注用于微调小型语言模型,将标签在全篇 PMC-OA 语料库中传播。得到的元数据允许我们提取精细化子集,包括 200 万段临床病例文字,其中 45 万多段来自具有商业许可证的文章的高质量文本,亦可通过质量筛选与领域上采样构建多个变体。临床文本因隐私限制通常难以获取,医院记录无法公开共享。因此,我们的数据集为生物医学及临床 NLP 提供了大规模、公开可得的临床病例集合,具有重要价值。 preliminary 的持续预训练实验表明,这些精选子集可实现目标性提升,临床上采样使 MMLU ProfMed 性能提升约 5%,教育质量筛选使 MedQA 与 MedMCQA 提升约 1%。这些技术的组合导致收敛更快,仅用三分之一训练标记即可达到相同性能,表明其在更高效与更有效的生物医学预训练策略中具有潜力。
引用
@article{arxiv.2506.20331,
title = {Biomed-Enriched: A Biomedical Dataset Enriched with LLMs for Pretraining and Extracting Rare and Hidden Content},
author = {Rian Touchent and Nathan Godey and Eric de la Clergerie},
journal= {arXiv preprint arXiv:2506.20331},
year = {2025}
}
备注
Dataset link: https://hf.co/datasets/almanach/Biomed-Enriched