中文

评估大型语言模型综合证候与治疗的基准数据集

计算与语言 2025-12-03 v1

摘要

大型语言模型(LLM)在传统中医(TCM)领域的出现,亟需评估其临床应用能力。然而,这类评估面临着TCM“证候分型与治疗”(SDT)个体化、整体性和多样性所带来的挑战。现有基准仅局限于知识库问答或证候分型准确性,往往忽视治疗决策的评估。本文提出一个由TCM专家精心构建的全面、基于临床病例的基准测试集,以及用于量化处方-证候匹配度的专用奖励模型。数据标注遵循严格的标注流程。该基准测试套件命名为TCM-BEST4SDT,涵盖四个任务,包括TCM基础知识、医学伦理、LLM内容安全与SDT。评估框架集成了三种机制,即选答评估、判题模型评估与奖励模型评估。通过在15个主流LLM(涵盖通用与TCM领域)上的实验验证了TCM-BEST4SDT的有效性。为推动智能化TCM研究,TCM-BEST4SDT现已公开发布。

关键词

引用

@article{arxiv.2512.02816,
  title  = {A benchmark dataset for evaluating Syndrome Differentiation and Treatment in large language models},
  author = {Kunning Li and Jianbin Guo and Zhaoyang Shang and Yiqing Liu and Hongmin Du and Lingling Liu and Yuping Zhao and Lifeng Dong},
  journal= {arXiv preprint arXiv:2512.02816},
  year   = {2025}
}