中文

TCM-Eval:面向中医的专家级动态可扩展基准

计算与语言 2025-12-29 v2

摘要

大型语言模型(LLM)在现代医学中展现出惊人的能力,但其在中医(TCM)领域的应用仍严重受限于缺乏标准化基准和高质量训练数据的不足。为此,我们引入 TCM-Eval,这是第一个为中医构建的动态可扩展基准,精心选自全国医师执业考试题目,并经中医专家验证。进一步,我们构建了大规模训练语料库,提出自迭代链律提升(Self-Iterative Chain-of-Thought Enhancement, SI-CoTE),通过拒绝抽样自主丰富经验证的推理链,建立数据与模型共演化的良性循环。利用此增强训练数据,我们开发了智明汤(ZhiMingTang, ZMT),这是一款专为中医设计的领先级大型语言模型,显著超越了人类从业者的合格线。为鼓励未来研究与发展,我们发布了公开排行榜,促进了社区参与和持续改进。

关键词

引用

@article{arxiv.2511.07148,
  title  = {TCM-Eval: An Expert-Level Dynamic and Extensible Benchmark for Traditional Chinese Medicine},
  author = {Zihao Cheng and Yuheng Lu and Huaiqian Ye and Zeming Liu and Minqi Wang and Jingjing Liu and Zihan Li and Wei Fan and Yuanfang Guo and Ruiji Fu and Shifeng She and Gang Wang and Yunhong Wang},
  journal= {arXiv preprint arXiv:2511.07148},
  year   = {2025}
}

备注

Work in Progress