Me LLaMA:面向医疗应用的基础大语言模型
计算与语言
2024-11-05 v5 人工智能
摘要
ChatGPT 和 LLaMA 等大语言模型(LLM)的最新进展在医疗应用中展现出潜力,但在医学语言理解方面仍面临挑战。本研究提出 Me-LLaMA,一种基于开源 LLaMA 模型的新型医疗 LLM 家族,通过利用大规模、特定领域的数据集,针对医学文本分析和诊断进行了优化。Me-LLaMA 家族包括基础模型 Me-LLaMA 13/70B 及其对话增强版本,通过使用来自生物医学和临床来源的 129B token 和 214K 样本进行持续预训练和指令微调而开发。训练 70B 模型需要超过 100,000 个 A100 GPU 小时。Me-LLaMA 的性能在六项医学文本分析任务中使用 12 个基准数据集和复杂临床病例诊断进行了评估,包含自动评估和人工评估。结果表明,Me-LLaMA 在零样本和监督设置下均优于 LLaMA 和其他开源医疗 LLM。特定任务微调进一步提升了性能,在 8 个数据集中的 7 个上超越 ChatGPT,在 8 个数据集中的 5 个上超越 GPT-4。对于复杂临床病例,Me-LLaMA 达到了与 ChatGPT 和 GPT-4 相当的性能。本研究强调了特定领域数据在开发医疗 LLM 中的重要性,并探讨了训练中涉及的高计算成本,突出了预训练与微调策略之间的平衡。Me-LLaMA 模型现已在用户协议下开放,为推进医疗 AI 提供宝贵资源。
引用
@article{arxiv.2402.12749,
title = {Me LLaMA: Foundation Large Language Models for Medical Applications},
author = {Qianqian Xie and Qingyu Chen and Aokun Chen and Cheng Peng and Yan Hu and Fongci Lin and Xueqing Peng and Jimin Huang and Jeffrey Zhang and Vipina Keloth and Xinyu Zhou and Lingfei Qian and Huan He and Dennis Shung and Lucila Ohno-Machado and Yonghui Wu and Hua Xu and Jiang Bian},
journal= {arXiv preprint arXiv:2402.12749},
year = {2024}
}
备注
21 pages, 4 figures, 8 tables