中文

LingLanMiDian:系统化评估 LLMs 在中医知识与临床推理方面的能力

人工智能 2026-02-03 v1

摘要

大语言模型(LLM)在医学自然语言处理领域正迅猛发展,但中医(TCM)因其独特的本体论、术语体系和推理模式,需要具备领域忠实性的评估。现有中医基准测试在覆盖面和规模上碎片化,评分方式依赖非统一或生成式打分,难以实现公平比较。我们提出LingLanMiDian(简称LingLan)基准,一个大规模、由专家精选、跨任务的综合评估套件,统一覆盖知识记忆、多跳推理、信息抽取和真实世界临床决策。LingLan引入一致的指标设计、临床标签的容错协议、每个数据集400题的Hard子集,以及将诊断和治疗建议重新框定为单选题识别。我们对14个主要开源和商业LLM进行了全面零样本评估,提供了统一视角下的其在中医常识知识理解、推理和临床决策支持方面的优势与局限;关键在于Hard子集的评估揭示了当前模型与中医专家在中医专业化推理方面的显著差距。通过桥接基础知识与应用推理,LingLan确立了一个统一、量化且可扩展的基础,为推动中医LLM和领域特定医学AI研究。所有评估数据与代码已提供于 https://github.com/TCMAI-BJTU/LingLan 和 http://tcmnlp.com。

关键词

引用

@article{arxiv.2602.01779,
  title  = {LingLanMiDian: Systematic Evaluation of LLMs on TCM Knowledge and Clinical Reasoning},
  author = {Rui Hua and Yu Wei and Zixin Shu and Kai Chang and Dengying Yan and Jianan Xia and Zeyu Liu and Hui Zhu and Shujie Song and Mingzhong Xiao and Xiaodong Li and Dongmei Jia and Zhuye Gao and Yanyan Meng and Naixuan Zhao and Yu Fu and Haibin Yu and Benman Yu and Yuanyuan Chen and Fei Dong and Zhizhou Meng and Pengcheng Yang and Songxue Zhao and Lijuan Pei and Yunhui Hu and Kan Ding and Jiayuan Duan and Wenmao Yin and Yang Gu and Runshun Zhang and Qiang Zhu and Jian Yu and Jiansheng Li and Baoyan Liu and Wenjia Wang and Xuezhong Zhou},
  journal= {arXiv preprint arXiv:2602.01779},
  year   = {2026}
}