中文

基于机器学习的临床试验给药错误早期风险分层

机器学习 2026-02-27 v1 人工智能

摘要

目标:本研究旨在开发基于机器学习(ML)的框架,利用试验启动前可获得的信息,对临床试验(CT)进行早期风险分层,以预测其出现高给药错误率的可能性。材料与方法:我们从ClinicalTrials.gov构建了由42,112个CT组成的 Dataset。提取结构化、准结构化试验数据及非结构化的方案相关自由文本数据。将CT分配为二元标签,指示其是否存在 elevated 给药错误率,这些标签来源于不良事件报告、MedDRA术语及Wilson置信区间。我们评估了在结构化特征上训练的XGBoost模型、使用文本数据的ClinicalModernBERT模型,以及结合两种模态的简单晚期融合模型。对后处理概率进行校准,以实现可解释的试验级别风险分层。结果:晚期融合模型获得了最高的AUC-ROC(0.862)。除了判别效能外,校准后的输出使我们能够将CTs稳健地划分为预定义的风险类别。标记为存在异常高给药错误率的试验比例在预测风险组别较高时单调增加,并与相应的预测概率范围相吻合。讨论:这些发现表明,给定药剂错误风险可以在试验级别上通过启动前信息予以预测。概率校准对于将模型输出转化为可靠且可解释的风险类别至关重要,而简单地进行多模态集成可在不要求复杂体系结构的情况下获得性能提升。结论:本研究引入了一个可复制且可扩展的ML框架,用于CTs在高给药错误率风险试验的早期、试验级别风险分层,支持临床研究中基于风险的质量管理。

关键词

引用

@article{arxiv.2602.22285,
  title  = {Early Risk Stratification of Dosing Errors in Clinical Trials Using Machine Learning},
  author = {Félicien Hêche and Sohrab Ferdowsi and Anthony Yazdani and Sara Sansaloni-Pastor and Douglas Teodoro},
  journal= {arXiv preprint arXiv:2602.22285},
  year   = {2026}
}