中文

ChiMed 2.0:面向大语言模型的中文医学数据集

计算与语言 2025-07-22 v1

摘要

构建高质量的数据资源是推动人工智能在特定领域研究与应用的关键,尤其是中文医学领域。现有中文医学数据集规模有限、领域覆盖狭窄,无法满足有效预训练所需的多样化语料。此外,大多数数据集仅用于LLM微调,不支持预训练和基于人类反馈的强化学习(RLHF)。本文提出中文医学数据集ChiMed 2.0,扩展了我们的前作ChiMed,涵盖来自中文医学在线平台及由大语言模型生成的数据。ChiMed 2.0包含20440万中文字符,涉及中医经典与现代医学数据,其中164800篇文档用于预训练,351600组问答对用于监督式微调(SFT),41700组偏好数据用于RLHF。为验证方法有效性,我们在代表性通用领域LLM上进行预训练、SFT和RLHF实验,并在医学基准数据集上评估效果。结果显示不同模型规模均取得性能提升,验证了数据集的有效性与适用性。

关键词

引用

@article{arxiv.2507.15275,
  title  = {ChiMed 2.0: Advancing Chinese Medical Dataset in Facilitating Large Language Modeling},
  author = {Yuanhe Tian and Junjie Liu and Zhizhou Kou and Yuxiang Li and Yan Song},
  journal= {arXiv preprint arXiv:2507.15275},
  year   = {2025}
}