BioMedLM:在生物医学文本上训练的 2.7B 参数语言模型
计算与语言
2024-03-28 v1 人工智能
摘要
诸如 GPT-4 和 Med-PaLM 2 等模型在各种生物医学 NLP 任务上展现出了令人印象深刻的性能。然而,这些模型拥有数千亿参数,运行计算成本高昂,要求用户通过互联网发送其输入数据,且训练数据来源未知。更小、更具针对性的模型能否与之竞争?为了回答这个问题,我们构建并发布了 BioMedLM,这是一个仅在 PubMed 摘要和全文文章上训练的 27 亿参数 GPT 风格自回归模型。经过微调,BioMedLM 在多项选择的生物医学问答任务上可以产生强大的结果,与更大的模型相竞争,例如在 MedMCQA (dev) 上取得 57.3% 的分数,在 MMLU Medical Genetics 考试上取得 69.0% 的分数。BioMedLM 还可以被微调以针对医学主题的患者问题生成有用的回答。这表明,对于特定的 NLP 应用(如生物医学领域),较小的模型有可能作为透明、保护隐私、经济且环保的基础。该模型可在 Hugging Face Hub 上获取:https://huggingface.co/stanford-crfm/BioMedLM。
引用
@article{arxiv.2403.18421,
title = {BioMedLM: A 2.7B Parameter Language Model Trained On Biomedical Text},
author = {Elliot Bolton and Abhinav Venigalla and Michihiro Yasunaga and David Hall and Betty Xiong and Tony Lee and Roxana Daneshjou and Jonathan Frankle and Percy Liang and Michael Carbin and Christopher D. Manning},
journal= {arXiv preprint arXiv:2403.18421},
year = {2024}
}
备注
23 pages