中文

MedBench:用于评估中文医学大型语言模型的全面、标准化和可靠基准系统

计算与语言 2024-07-17 v1 人工智能

摘要

在医学大型语言模型(LLM)获得人类满意度前确保其普遍有效性和良好性至关重要。然而,尤其是在中文语境下,尚未建立一个被广泛接受且可获取的评估流程。在本工作中,我们介绍了“MedBench”,一个用于中文医学LLM的全面、标准化和可靠基准系统。首先,MedBench汇集了目前规模最大的评估数据集(300,901个问题),覆盖43个临床专科,并对医学LLM进行多维度评估。其次,MedBench提供标准化的、基于云端的全自动评估基础设施,问题与真实答案之间物理分离。第三,MedBench实施动态评估机制以防止捷径学习和答案记忆。将MedBench应用于流行的通用和医学LLM,我们观察到评估结果是无偏的、可重复的,并且大大符合医疗专业人士的观点。这一研究为中文医学LLM的实际应用奠定了重要基础。MedBench已公开访问,网址为https://medbench.opencompass.org.cn。

关键词

引用

@article{arxiv.2407.10990,
  title  = {MedBench: A Comprehensive, Standardized, and Reliable Benchmarking System for Evaluating Chinese Medical Large Language Models},
  author = {Mianxin Liu and Jinru Ding and Jie Xu and Weiguo Hu and Xiaoyang Li and Lifeng Zhu and Zhian Bai and Xiaoming Shi and Benyou Wang and Haitao Song and Pengfei Liu and Xiaofan Zhang and Shanshan Wang and Kang Li and Haofen Wang and Tong Ruan and Xuanjing Huang and Xin Sun and Shaoting Zhang},
  journal= {arXiv preprint arXiv:2407.10990},
  year   = {2024}
}

备注

25 pages.4 figures