面向药理流行病学研究设计的通用型与生物医学型大语言模型的高级提示工程
计算与语言
2026-04-21 v1
摘要
背景:大语言模型 (LLM) 自动化和支持药理流行病学研究设计的潜力是日益受到关注的领域,但其可靠性尚未得到充分阐述。通用型 LLM 常显示不准确,而针对该领域的专用生物医学 LLM 的比较性能尚未为人所知。方法:本研究评估了通用型 LLM (GPT-4o 和 DeepSeek-R1) 与生物医学微调 LLM (QuantFactory/Bio-Medical-Llama-3-8B-GGUF 和 Irathernotsay/qwen2-1.5B-medical_qa-Finetune) 在 46 项来自 HMA-EMA 目录和 Sentinel 系统的协议中的表现。通过最小-最大 (Least-to-Most, LTM) 和主动提示策略,对相关性、论证逻辑性以及多种编码系统下的本体码一致性进行评估。结果:GPT-4o 和 DeepSeek-R1 配合 LTM 提示策略在相关性和论证逻辑性得分方面取得最高水平,GPT-4o-LTM 在 HMA-EMA 协议中 8/9 题的相关性得分中位数为 4。生物医学 LLM 整体相关性较低且频繁生成不充分的论证。所有 LLM 在本体码映射方面表现有限,尽管 LTM 在推理稳定性方面提供了最一致的改进。结论:现场通用型 LLM 当前在药理流行病学设计支持方面优于生物医学 LLM。提示策略对 LLM 性能影响显著。
引用
@article{arxiv.2604.17988,
title = {Employing General-Purpose and Biomedical Large Language Models with Advanced Prompt Engineering for Pharmacoepidemiologic Study Design},
author = {Xinyao Zhang and Nicole Sonne Heckmann and Manuela Del Castillo Suero and Francesco Paolo Speca and Maurizio Sessa},
journal= {arXiv preprint arXiv:2604.17988},
year = {2026}
}