ProtoMed-LLM:面向医学协议制定的大型语言模型自动评估框架
计算与语言
2025-04-15 v2
摘要
由机器人可执行的科学协议的自动生成能显著加速科学研究过程。大型语言模型(LLM)在科学协议制定任务(SPFT)中表现出色,但对其能力的评估依赖于人工评估。在此,我们提出了一个灵活、自动的框架来评估LLM在SPFT上的能力:ProtoMed-LLM。该框架提示目标模型和GPT-4仅使用预定义的实验室操作从生物学协议中提取伪代码,并使用LLAM-EVAL评估目标模型的输出,其中GPT-4生成的伪代码作为基线,Llama-3作为评估器。我们适应性强的基于提示的评估方法LLAM-EVAL在评估模型、材料、标准方面提供了显著的灵活性,并且无需成本。我们评估了GPT变体、Llama、Mixtral、Gemma、Cohere和Gemini。总体而言,我们发现GPT和Cohere是强大的科学协议制定者。我们还引入了BIOPROT 2.0,这是一个包含生物学协议和相应伪代码的数据集,可辅助LLM进行SPFT的制定和评估。我们的工作可扩展至评估LLM在不同领域以及需要为特定目标生成协议的其他领域中的SPFT能力。
引用
@article{arxiv.2410.04601,
title = {ProtoMed-LLM: An Automatic Evaluation Framework for Large Language Models in Medical Protocol Formulation},
author = {Seungjun Yi and Jaeyoung Lim and Juyong Yoon},
journal= {arXiv preprint arXiv:2410.04601},
year = {2025}
}
备注
Oral Presentation at the 2025 Conference on Health IT and Analytics (CHITA 2025)