中文

通过基于强化学习的数值推理增强临床试验论文的研究级推断

人工智能 2026-01-26 v3 计算与语言

摘要

医学系统综述通过汇总多项研究的发现,在循证决策中发挥着关键作用。自动化这一过程的核心瓶颈在于提取数值证据并针对特定结局和比较确定研究级结论。先前的工作通过检索相关内容片段并从中推断结论,将此问题构建为文本推断任务。然而,此类方法通常依赖浅层文本线索,无法捕捉专家评估背后的底层数值推理。在本工作中,我们将该问题概念化为定量推理。我们不再从表面文本推断结论,而是提取结构化数值证据(如事件计数或标准差),并应用领域知识驱动的逻辑来推导特定结局的结论。我们开发了一个数值推理系统,由数值数据提取模型和效应估计组件组成,从而实现与领域专家原则一致的更准确且可解释的推断。我们采用不同策略训练数值数据提取模型,包括监督微调(SFT)和使用新型价值奖励模型的强化学习(RL)。在 CochraneForest 基准上评估时,我们表现最佳的方法——使用 RL 训练小规模数值提取模型——在 F1 分数上比基于检索的系统最高绝对提升 21%,并在 RCTs 基准上超越超过 400B 参数的通用 LLMs 最高达 9%。我们的结果证明了推理驱动方法在自动化系统证据合成方面的潜力。

关键词

引用

@article{arxiv.2505.22928,
  title  = {Enhancing Study-Level Inference from Clinical Trial Papers via Reinforcement Learning-Based Numeric Reasoning},
  author = {Massimiliano Pronesti and Michela Lorandi and Paul Flanagan and Oisin Redmond and Anya Belz and Yufang Hou},
  journal= {arXiv preprint arXiv:2505.22928},
  year   = {2026}
}

备注

Accepted at EMNLP 2025 Main Conference. This revision corrects a minor typo in the camera-ready version