大语言模型简化临床研究中的自动化机器学习流程
机器学习
2024-02-22 v5 人工智能
计算与语言
摘要
机器学习(ML)开发者(如数据科学家)与从业者(如临床医生)之间持续存在知识鸿沟,阻碍了 ML 在临床数据分析中的充分利用。我们探究了 ChatGPT 高级数据分析(ADA,GPT-4 的扩展)在弥合此鸿沟并高效执行 ML 分析方面的潜力。将来自不同医学专科大型试验的真实临床数据集与研究细节提供给 ChatGPT ADA,且未给予具体指导。ChatGPT ADA 基于原始研究的训练数据自主开发了最先进的 ML 模型,用于预测癌症发生、癌症进展、疾病并发症等临床结局,或预测如致病基因序列等生物标志物。在重新实现并优化已发布模型后,对 ChatGPT ADA 构建的 ML 模型与对应人工构建模型进行头对头比较,显示传统性能指标无显著差异(P>0.071)。引人注目的是,ChatGPT ADA 构建的 ML 模型常优于其对应模型。总之,ChatGPT ADA 通过简化复杂数据分析,为医学 ML 的普及提供了一条大有前景的途径,但其应增强而非取代专业培训与资源,以促进在医学研究与实践中的更广泛应用。
引用
@article{arxiv.2308.14120,
title = {Large Language Models Streamline Automated Machine Learning for Clinical Studies},
author = {Soroosh Tayebi Arasteh and Tianyu Han and Mahshad Lotfinia and Christiane Kuhl and Jakob Nikolas Kather and Daniel Truhn and Sven Nebelung},
journal= {arXiv preprint arXiv:2308.14120},
year = {2024}
}
备注
Published in Nature Communications