中文

利用 LLM 从 RCT 报告中联合抽取干预、结局与发现

计算与语言 2023-07-19 v3

摘要

随机对照试验(RCT)的结果确立了干预措施的比较有效性,并反过来是基于证据诊疗的关键输入。然而,RCT 的结果以(通常非结构化的)自然语言文章呈现,描述试验的设计、执行与结局;临床医生必须手动从此类文章中提取与关注干预和结局相关的发现。这一繁重的手动过程推动了从试验报告(半)自动抽取结构化证据的工作。本文中,我们提出并评估了一个基于指令微调大语言模型(LLM)构建的文本到文本模型,用于从临床摘要中联合抽取干预、结局与比较者(ICO 要素),并推断所报告的关联结果。人工(专家)与自动评估表明,将证据抽取构建为条件生成任务并为此微调 LLM,相较先前 SOTA 实现了可观(约 20 个绝对 F1 分数点)的提升。我们进行了消融实验与错误分析,以评估影响模型性能的方面,并指出进一步改进的潜在方向。我们将模型应用于截至 2022 年中发表的一组 RCT,并发布了一个可检索的结构化发现数据库:http://ico-relations.ebm-nlp.com

关键词

引用

@article{arxiv.2305.03642,
  title  = {Jointly Extracting Interventions, Outcomes, and Findings from RCT Reports with LLMs},
  author = {Somin Wadhwa and Jay DeYoung and Benjamin Nye and Silvio Amir and Byron C. Wallace},
  journal= {arXiv preprint arXiv:2305.03642},
  year   = {2023}
}

备注

Accepted to MLHC 2023