TheBlueScrubs-v1:来自互联网的综合性精选医学数据集
计算与语言
2025-04-07 v1
摘要
训练临床大型语言模型(cLLMs)需要稳健且多样化的数据集,但当前可用的公共数据集在规模或范围上往往不足以支持全面的医疗应用。虽然PubMed等资源提供了医学文献的基础,但仅覆盖狭窄的正式出版物,遗漏了互联网上更广泛的医学讨论。为此,我们介绍TheBlueScrubs-v1,一个来自广泛互联网语料库的精选数据集,包含超过250亿医学token——约为PubMed的三倍。我们的两阶段过滤管道采用Logistic回归模型进行文档筛选(在外部验证上AUC约为0.95),随后由70B参数的Llama 3.1 instruct模型进行验证。每个文本被赋予三个LLM评估分数,涵盖医学相关性、精确性和事实细节以及安全伦理标准。临床医生的评审确认这些自动化评估与人工评估高度一致,另外还有一个专门的癌症分类器进一步标记约110亿肿瘤相关token。两个演示任务突显了数据集的实际价值:首先,我们将安全评估蒸馏到一个较小的BERT风格模型,该模型在 unseen 数据上达到接近0.96的AUC;其次,我们在过滤后的子集上微调一个紧凑型LLM,显示在医学基准测试以及私有数据集上均显著优于标准基线。本数据描述符详细阐述了数据集的创建与验证,凸显了其在医疗AI研究中的潜在实用性。
引用
@article{arxiv.2504.02874,
title = {TheBlueScrubs-v1, a comprehensive curated medical dataset derived from the internet},
author = {Luis Felipe and Carlos Garcia and Issam El Naqa and Monique Shotande and Aakash Tripathi and Vivek Rudrapatna and Ghulam Rasool and Danielle Bitterman and Gilmer Valdes},
journal= {arXiv preprint arXiv:2504.02874},
year = {2025}
}
备注
22 pages, 8 figures, 10 tables