中文

TCMBench: 评估大型语言模型在中医领域表现的综合基准

计算与语言 2024-06-04 v1 人工智能

摘要

大型语言模型(LLMs)通过基准测试在各种自然语言处理任务中表现出色,包括在西方医学领域。然而,在具有深厚历史和广泛影响力的中医领域,针对LLMs的专业评估基准尚属空白。为填补这一研究空白,我们引入了TCM-Bench,一个用于评估LLM在中医领域表现的综合基准。它包含TCM-ED数据集,由来自中医执业医师资格考试(TCMLE)的5,473个问题组成,其中1,300个问题附有权威分析。该基准涵盖了TCMLE的核心组成部分,包括中医基础理论和临床实践。为了超越问答准确率来评估LLM,我们提出了TCMScore,这是一个专门用于评估LLM针对中医相关问题生成答案质量的指标。它综合考虑了中医语义和知识的一致性。通过从不同角度进行全面的实验分析,我们得到以下发现:(1)LLMs在该基准上的表现不尽如人意,表明它们在中医领域还有很大的改进空间。(2)引入领域知识可以提升LLMs的性能。然而,对于像ZhongJing-TCM这样的领域内模型,生成的分析文本质量有所下降,我们推测其微调过程影响了基础的LLM能力。(3)传统的文本生成质量指标如Rouge和BertScore容易受到文本长度和表面语义歧义的影响,而像TCMScore这样的领域特定指标可以进一步补充和解释其评估结果。这些发现揭示了LLMs在中医领域的能力和局限性,旨在为医学研究提供更深入的帮助。

关键词

引用

@article{arxiv.2406.01126,
  title  = {TCMBench: A Comprehensive Benchmark for Evaluating Large Language Models in Traditional Chinese Medicine},
  author = {Wenjing Yue and Xiaoling Wang and Wei Zhu and Ming Guan and Huanran Zheng and Pengfei Wang and Changzhi Sun and Xin Ma},
  journal= {arXiv preprint arXiv:2406.01126},
  year   = {2024}
}

备注

20 pages, 15 figures