中文

用于药物研发中临床试验成功预测的统计自然语言处理

机器学习 2025-12-02 v1 计算与语言 定量方法

摘要

本工作提出了开发和评估一种基于统计自然语言处理技术的概率分类器,用于估计神经科学领域临床试验的技术和监管成功概率 (pTRS)。尽管药物研发面临高额成本和高 attrition rate,尤其在神经科学领域,成功率不足 10%,及时识别有前景的项目有助于优化资源分配并降低财务风险。本研究利用来自 ClinicalTrials.gov 数据库的数据和来自最近开发的临床试验结果数据集的成功标签,通过统计 NLP 技术提取基于文本的临床试验特征。这些特征被整合到逻辑回归、梯度提升和随机森林等非大语言模型框架中,以生成校准的概率得分。模型在覆盖 1976-2024 年、共计 101,145 项已完成临床试验的回顾性数据集上进行评估,实现了整体 ROC-AUC 为 0.64。随后构建了一个基于 BioBERT 的大语言模型预测模型,该模型实现了整体 ROC-AUC 为 0.74 和 Brier 分数为 0.185,表明其预测平均比行业基准模型少 40% 的平方误差。BioBERT 模型还在整体上 70% 的情况下做出了优于基准值的试验结果预测。通过将 NLP 提取的见解整合到药物开发决策中,本工作旨在增强神经科学项目的战略规划和投资配置。

关键词

引用

@article{arxiv.2512.00586,
  title  = {Statistical NLP for Optimization of Clinical Trial Success Prediction in Pharmaceutical R&D},
  author = {Michael R. Doane},
  journal= {arXiv preprint arXiv:2512.00586},
  year   = {2025}
}

备注

Doctor of Engineering Praxis Dissertation, The George Washington University. 122 pages. Present affiliation: Iambic Therapeutics