基于 GEPA 训练程序化提示框架的随机对照试验风险偏差自动评估:首次探索
人工智能
2025-12-02 v1
摘要
评估随机对照试验的风险偏差(RoB)对于可信的证据综合至关重要,但该过程资源密集且容易因评审者之间存在差异而产生变异性。大型语言模型(LLM)提供了一种自动化途径,但现有方法依赖手动工程化的提示词,难以复现、泛化或评估。本研究引入了一个可编程的 RoB 评估管道,通过 DSPy 及其 GEPA 模块实现结构化、基于代码的优化,取代 ad-hoc 提示设计。GEPA 通过帕累托引导搜索细化 LLM 推理过程,生成可检查的执行轨迹,使优化过程的每一步都能够透明复制。我们在来自七个 RoB 领域的已发表 meta 分析中的 100 项 RCT 上进行了评估。将 GEPA 生成的提示词应用于开源模型(Mistral Small 3.1 和 GPT-oss-20b)和商业模型(GPT-5 Nano 和 GPT-5 Mini)。在方法论报告较为清晰的领域,如随机序列生成,GEPA 生成的提示词表现最佳,分配掩盖和参与者盲法的结果相似,而商业模型整体略胜一筹。我们还将 GEPA 与三个手动设计的提示词进行了比较。GEPA 在整体准确率上取得最高水平,在随机序列生成和选择性报告方面的性能提升了 30%至 40%,在其他领域相对于手动提示词表现出 generally comparable、竞争性的性能。这些发现表明,GEPA 能够产生一致且可复现的提示词,用于 RoB 评估,支持在证据综述中结构化且原则化地使用 LLM。
引用
@article{arxiv.2512.01452,
title = {Automated Risk-of-Bias Assessment of Randomized Controlled Trials: A First Look at a GEPA-trained Programmatic Prompting Framework},
author = {Lingbo Li and Anuradha Mathrani and Teo Susnjak},
journal= {arXiv preprint arXiv:2512.01452},
year = {2025}
}