中文

基于大语言模型的临床试验匹配流程系统综述

计算与语言 2025-09-25 v1 人工智能

摘要

将患者与临床试验选项进行匹配对于发现新型治疗方法至关重要,尤其是在肿瘤学领域。然而,人工匹配劳动密集且易出错,导致招募延迟。结合大语言模型(LLMs)的流程提供了一种有前景的解决方案。我们从三个学术数据库和一个预印本服务器中,对2020年至2025年间发表的研究进行了系统综述,识别了基于LLM的临床试验匹配方法。在126篇独特文章中,31篇符合纳入标准。所综述的研究专注于仅患者-标准匹配(n=4)、仅患者-试验匹配(n=10)、仅试验-患者匹配(n=2)、仅二元资格分类(n=1)或组合任务(n=14)。十六项研究使用了合成数据;十四项使用了真实患者数据;一项两者兼用。数据集和评估指标的差异性限制了跨研究的可比性。在有直接比较的研究中,GPT-4模型在匹配和资格提取方面始终优于其他模型,即使是经过微调的模型,尽管成本更高。有前景的策略包括使用如GPT-4o模型等专有LLM进行零样本提示、先进的检索方法,以及在将大型模型集成到医院基础设施中不可行时,为保护数据隐私而微调较小的开源模型。关键挑战包括获取足够大规模的真实世界数据集,以及与部署相关的挑战,如降低成本、减轻幻觉风险、数据泄露和偏见。本综述综合了将LLM应用于临床试验匹配的进展,突出了有前景的方向和关键局限性。标准化的指标、更真实的测试集以及对成本效益和公平性的关注,对于更广泛的部署至关重要。

关键词

引用

@article{arxiv.2509.19327,
  title  = {A systematic review of trial-matching pipelines using large language models},
  author = {Braxton A. Morrison and Madhumita Sushil and Jacob S. Young},
  journal= {arXiv preprint arXiv:2509.19327},
  year   = {2025}
}

备注

28 pages, 3 figures