中文

基于一百万临床试验开发面向临床研究的大语言模型

人工智能 2025-12-17 v2

摘要

为临床研究开发人工智能 (AI) 系统需要全面的数据基础以支持模型训练和严格评估。本文介绍了 TrialPanorama,一个大规模结构化资源,汇集来自十五个全球注册中心的 160 万条临床试验记录,并链接生物医学本体法和相关文献。为演示其实用性,我们构建了一个管道,为八个关键临床研究任务构建 152K 条训练和测试样本。其中三个任务支持系统综述工作流程,包括研究搜索、研究筛选和证据总结。另外五个任务聚焦试验设计与优化,包括臂设计、准入标准设计、终点选择、样本量估算和试验完成性评估与合理化。对标最新大语言模型 (LLM) 显示,通用 LLM 在临床推理方面能力有限。相比之下,我们在 TrialPanorama 上使用监督微调和强化学习开发的一个 8B 参数 LLM 在所有八个任务中超越 70B 通用模型,分别实现了 73.7%、67.6%、38.4%、37.8%、26.5%、20.7%、20.0%、18.1% 和 5.2% 的相对提升。我们设想 TrialPanorama 为未来 AI 临床研究规模化提供坚实基础。

关键词

引用

@article{arxiv.2505.16097,
  title  = {Developing Large Language Models for Clinical Research Using One Million Clinical Trials},
  author = {Zifeng Wang and Jiacheng Lin and Qiao Jin and Junyi Gao and Jathurshan Pradeepkumar and Pengcheng Jiang and Zhiyong Lu and Jimeng Sun},
  journal= {arXiv preprint arXiv:2505.16097},
  year   = {2025}
}