Baichuan-M1:推动大语言模型医学能力的实践
计算与语言
2025-03-06 v2
摘要
当前生成的大语言模型(LLM)通常设计用于广泛的通用应用,而针对特定领域的模型——尤其是医学等垂直领域的模型——相对稀缺。特别是,针对医学领域开发高效且实用的模型具有挑战性,这源于医学知识的复杂性以及高质量数据的稀缺。为弥合这一差距,我们介绍Baichuan-M1,一系列专为医学应用优化的大语言模型。不同于传统方法仅在现有模型上继续预训练或对通用基础模型进行后训练,Baichuan-M1是从头训练的,专注于增强医学能力。我们的模型在20万亿个标记上进行训练,包含多种有效的训练方法,在通用能力与医学专业知识之间取得平衡。结果表明,Baichuan-M1不仅在数学、编码等通用领域表现强劲,也在专门的医学领域中表现卓越。我们已开源Baichuan-M1-14B型号的迷你版本。
关键词
引用
@article{arxiv.2502.12671,
title = {Baichuan-M1: Pushing the Medical Capability of Large Language Models},
author = {Bingning Wang and Haizhou Zhao and Huozhi Zhou and Liang Song and Mingyu Xu and Wei Cheng and Xiangrong Zeng and Yupeng Zhang and Yuqi Huo and Zecheng Wang and Zhengyun Zhao and Da Pan and Fei Kou and Fei Li and Fuzhong Chen and Guosheng Dong and Han Liu and Hongda Zhang and Jin He and Jinjie Yang and Kangxi Wu and Kegeng Wu and Lei Su and Linlin Niu and Linzhuang Sun and Mang Wang and Pengcheng Fan and Qianli Shen and Rihui Xin and Shunya Dang and Songchi Zhou and Weipeng Chen and Wenjing Luo and Xin Chen and Xin Men and Xionghai Lin and Xuezhen Dong and Yan Zhang and Yifei Duan and Yuyan Zhou and Zhi Ma and Zhiying Wu},
journal= {arXiv preprint arXiv:2502.12671},
year = {2025}
}
备注
33 pages, technical report