CMB:一个综合性的中文医学基准
计算与语言
2024-04-05 v2 人工智能
摘要
大语言模型(LLMs)为医学领域的重大突破提供了可能性。建立标准化的医学基准成为衡量进展的基础基石。然而,不同地区的医疗环境具有其本地特征,例如中医在中国内的普遍性与重要性。因此,仅翻译基于英文的医学评估可能导致与本地区域的语境不一致。为解决该问题,我们提出了一个本地化的医学基准 CMB(一个综合性的中文医学基准),其完全在中国本土语言与文化框架内设计并扎根。尽管中医是该评估的组成部分,但其并非全部。利用此基准,我们评估了若干知名的大规模 LLMs,包括 ChatGPT、GPT-4、专用的中文 LLMs,以及专精于医学领域的 LLMs。我们希望该基准能提供现有医学 LLMs 的一手经验,并推动医学 LLMs 在中国的广泛采用与提升。我们的数据和代码公开于 https://github.com/FreedomIntelligence/CMB。
引用
@article{arxiv.2308.08833,
title = {CMB: A Comprehensive Medical Benchmark in Chinese},
author = {Xidong Wang and Guiming Hardy Chen and Dingjie Song and Zhiyi Zhang and Zhihong Chen and Qingying Xiao and Feng Jiang and Jianquan Li and Xiang Wan and Benyou Wang and Haizhou Li},
journal= {arXiv preprint arXiv:2308.08833},
year = {2024}
}
备注
Accepted to NAACL 2024 Main Conference