AutoMedEval:利用大语言模型进行医学能力自动评估
计算与语言
2025-05-20 v1
摘要
随着大型语言模型(LLM)在医学领域的广泛应用,对评估技术的需求日益增长。然而,传统指标如 F1 和 ROUGE 仅依赖 token 重合度衡量质量,显著忽视了医学术语的重要性。人工评估虽较可靠,但成本高昂且可能因人类专长和动机限制而出错。虽已有基于 LLM 的评估方法,但因 proprietary 属性或缺乏医学专业知识,难以在医学领域实际应用。为此,我们提出 AutoMedEval,一个由 13B 参数构成的开源自动评估模型,专为衡量医学 LLM 的问答能力而设计。AutoMedEval 的目标是评估不同模型生成响应的质量,旨显著降低对人工评估的依赖。具体而言,我们提出分层训练方法,包括课程指令调优与迭代知识内省机制,使 AutoMedEval 能在有限指令数据下获取专业医学评估能力。人工评估结果表明,AutoMedEval 在与人类判断相关性方面超越其他基线模型。
关键词
引用
@article{arxiv.2505.11887,
title = {AutoMedEval: Harnessing Language Models for Automatic Medical Capability Evaluation},
author = {Xiechi Zhang and Zetian Ouyang and Linlin Wang and Gerard de Melo and Zhu Cao and Xiaoling Wang and Ya Zhang and Yanfeng Wang and Liang He},
journal= {arXiv preprint arXiv:2505.11887},
year = {2025}
}