人工智能能否预测临床试验结果?
机器学习
2025-03-19 v2 应用统计
摘要
本研究评估了大型语言模型(LLM)和 HINT 模型在预测临床试验结果方面的性能,关注包括平衡准确率、Matthews 相关系数(MCC)、召回率和特异度等指标。结果表明,GPT-4o 在 LLM 中实现了卓越的整体性能,但像其它模型(GPT-3.5、GPT-4mini、Llama3)一样,在识别负面结果方面存在困难。相比之下,HINT 在负样本识别方面表现出色,对外部因素(如招募挑战)具有鲁棒性,但在肿瘤学试验中表现不佳,这些试验是数据集的主要组成部分。LLM 在早期阶段的试验以及诸如整体生存率(OS)等较简单的终点方面表现出色,而 HINT 在试验阶段之间保持一致性,并在复杂终点(如客观反应率)方面表现卓越。试验持续时间分析揭示,对于中长期试验,模型性能得到改善,GPT-4o 和 HINT 分别表现出稳定性和增强的特异性。我们强调,LLM(如 GPT-4o、Llama3)和 HINT 的潜在互补性,主张采用混合方法,以发挥 GPT-4o 的预测能力和 HINT 的特异性,用于临床试验结果预测。
引用
@article{arxiv.2411.17595,
title = {Can artificial intelligence predict clinical trial outcomes?},
author = {Shuyi Jin and Lu Chen and Hongru Ding and Meijie Wang and Lun Yu},
journal= {arXiv preprint arXiv:2411.17595},
year = {2025}
}