中文

AutoMedEval:利用大语言模型进行医学能力自动评估

计算与语言 2025-05-20 v1

摘要

随着大型语言模型(LLM)在医学领域的广泛应用,对评估技术的需求日益增长。然而,传统指标如 F1 和 ROUGE 仅依赖 token 重合度衡量质量,显著忽视了医学术语的重要性。人工评估虽较可靠,但成本高昂且可能因人类专长和动机限制而出错。虽已有基于 LLM 的评估方法,但因 proprietary 属性或缺乏医学专业知识,难以在医学领域实际应用。为此,我们提出 AutoMedEval,一个由 13B 参数构成的开源自动评估模型,专为衡量医学 LLM 的问答能力而设计。AutoMedEval 的目标是评估不同模型生成响应的质量,旨显著降低对人工评估的依赖。具体而言,我们提出分层训练方法,包括课程指令调优与迭代知识内省机制,使 AutoMedEval 能在有限指令数据下获取专业医学评估能力。人工评估结果表明,AutoMedEval 在与人类判断相关性方面超越其他基线模型。

关键词

引用

@article{arxiv.2505.11887,
  title  = {AutoMedEval: Harnessing Language Models for Automatic Medical Capability Evaluation},
  author = {Xiechi Zhang and Zetian Ouyang and Linlin Wang and Gerard de Melo and Zhu Cao and Xiaoling Wang and Ya Zhang and Yanfeng Wang and Liang He},
  journal= {arXiv preprint arXiv:2505.11887},
  year   = {2025}
}