基于约束满足的临床试验匹配的可扩展高召回信息检索
计算与语言
2026-04-13 v1 人工智能
数据库
多智能体系统
符号计算
摘要
临床试验是以证据为基础的医学的核心,但尽管已有超过半数百万项试验列在 ClinicalTrials.gov 上,每月吸引约两百万用户,仍有许多试验难以满足招募目标。现有的检索技术主要基于患者档案与资格标准之间的关键词和嵌入相似度匹配,常面临召回率低、精确率低和可解释性有限的问题,由于复杂约束。我们提出了 SatIR,一种基于约束满足的可扩展临床试验检索方法,实现高精度和可解释的患者与相关试验匹配。我们的方法使用形式方法——满足模理论(SMT)和关系代数——高效表示和匹配来自临床试验和患者记录的关键约束。除了利用既有的医学本体和概念模型外,我们使用大型语言模型(LLM)将关于模糊性、隐含临床假设和不完整患者记录的非正式推理转化为明确、精确、可控制和可解释的形式约束。在 59 名患者和 3,621 项试验的评估中,SatIR 在所有三个被评估的检索目标上均优于 TrialGPT。它每位患者检索出 32%-72% 更多相关且符合资格的试验,召回率提高了 22-38 分,服务的患者中至少有一个有用试验的比例显著提升。检索速度快,需 2.95 秒即可检索 3,621 项试验。这些结果表明,SatIR 是可扩展的、有效的和可解释的。
引用
@article{arxiv.2604.08849,
title = {Scalable High-Recall Constraint-Satisfaction-Based Information Retrieval for Clinical Trials Matching},
author = {Cyrus Zhou and Yufei Jin and Yilin Xu and Yu-Chiang Wang and Chieh-Ju Chao and Monica S. Lam},
journal= {arXiv preprint arXiv:2604.08849},
year = {2026}
}
备注
Under review