评估中等规模语言模型在临床问答任务中的潜力
计算与语言
2024-04-25 v1 人工智能
摘要
大型语言模型,如 GPT-4 和 Med-PaLM,在临床任务上表现出色;但它们需要访问计算资源,且为闭源,无法在设备上部署。诸如 BioGPT-large、BioMedLM、LLaMA 2 和 Mistral 7B 等中等规模模型规避了这些缺点,但其在临床任务中的能力尚未得到充分研究。为帮助评估其在临床应用中的潜力并帮助研究人员决定应使用哪个模型,我们比较了它们在两项临床问答 (QA) 任务上的表现:MedQA 和消费者查询问答。我们发现Mistral 7B 是表现最佳的模型,在所有基准测试中均获胜,并超过了专为医学领域训练的模型。虽然Mistral 7B 的 MedQA 分数为 63.0%,接近原始 Med-PaLM,并且常常能够生成对消费者健康查询的合理响应,但仍有提升空间。该研究首次对开源中等规模模型在临床任务上进行头盼比较评估。
引用
@article{arxiv.2404.15894,
title = {Assessing The Potential Of Mid-Sized Language Models For Clinical QA},
author = {Elliot Bolton and Betty Xiong and Vijaytha Muralidharan and Joel Schamroth and Vivek Muralidharan and Christopher D. Manning and Roxana Daneshjou},
journal= {arXiv preprint arXiv:2404.15894},
year = {2024}
}
备注
25 pages, 8 figures