中文

CareBot:面向医疗领域的开源全流程医学语言模型

计算与语言 2024-12-24 v2 人工智能

摘要

最近,闭源大语言模型和开源社区在各个通用领域都取得了显著进展,甚至超过了人类的表现。然而,在专业领域如医学中,尤其是在开源社区中,其表现仍不理想,这源于医学知识的复杂性。本文提出了CareBot,这是一个双语医学大语言模型,采用综合方法,集成了连续预训练(CPT)、监督式微调(SFT)和基于人类反馈的强化学习(RLHF)。我们提出了两种阶段的CPT方法,包括稳定CPT和提升CPT,有效弥合了通用数据与领域特定数据的差距,促进从预训练到微调的顺畅过渡,并逐步提升领域知识。我们还引入DataRater,用于评估CPT期间的数据质量,确保训练数据准确且相关。对于SFT,我们构建了一个大型且多样化的双语数据集,同时开发了ConFilter指标以提升多轮对话质量,这对于提高模型处理更复杂对话的能力至关重要。高质量数据源和创新技术的结合显著提高了CareBot在各种医学应用中的性能。我们的严格评估在中文和英文基准测试中确认了CareBot在医疗咨询和教育方面的有效性。这些突破不仅解决了当前医学大语言模型的局限性,也为开发有效可靠的开源医学模型树立了新标准。我们将在稍后开源数据集和模型,为研究社区贡献宝贵资源。

关键词

引用

@article{arxiv.2412.15236,
  title  = {CareBot: A Pioneering Full-Process Open-Source Medical Language Model},
  author = {Lulu Zhao and Weihao Zeng and Xiaofeng Shi and Hua Zhou},
  journal= {arXiv preprint arXiv:2412.15236},
  year   = {2024}
}

备注

Accept by AAAI 2025