中文

BianCang: 一个中医大语言模型

计算与语言 2025-10-01 v2 人工智能

摘要

大语言模型的涌现推动了医疗应用领域的重大进展,包括中医领域。然而,由于中医与现代医学理论之间存在巨大差异,且缺乏专门的高质量语料库,当前的医疗 LLM 在中医诊断与辨证方面面临困难。为此,本文提出了一个中医专用的 LLM——BianCang,它采用两阶段训练过程,首先注入领域特定知识,随后通过定向刺激进行对齐,以增强诊断与辨证能力。具体而言,我们基于真实医院记录构建了预训练语料库、指令对齐数据集,以及源自《中华人民共和国药典》的 ChP-TCM 数据集。我们汇编了大量的中医与医学语料库用于持续预训练和监督微调,构建了一个综合数据集以提升模型对中医的理解。在涉及 31 个模型和 4 项任务的 11 个测试集上的评估证明了 BianCang 的有效性,为未来研究提供了有价值的见解。代码、数据集和模型可在 https://github.com/QLU-NLP/BianCang 获取。

关键词

引用

@article{arxiv.2411.11027,
  title  = {BianCang: A Traditional Chinese Medicine Large Language Model},
  author = {Sibo Wei and Xueping Peng and Yi-Fei Wang and Tao Shen and Jiasheng Si and Weiyu Zhang and Fa Zhu and Athanasios V. Vasilakos and Wenpeng Lu and Xiaoming Wu and Yinglong Wang},
  journal= {arXiv preprint arXiv:2411.11027},
  year   = {2025}
}