中文

关闭开源大语言模型与商业大语言模型在医学证据摘要任务上的差距

计算与语言 2024-08-02 v1 人工智能

摘要

大型语言模型(LLM)在医学证据摘要方面具有巨大的潜力。最近的大多数研究聚焦于专有型LLM的应用。使用专有型LLM会引入多种风险因素,包括缺乏透明度和供应商依赖性。虽然开源LLM能够提供更好的透明度和定制化,但其性能在专有型模型之下。在本研究中,我们调查了通过微调开源LLM是否能够进一步提高其在医学证据摘要任务中的性能。我们利用由8,161对系统综述与摘要组成的基准数据集MedReview,对三种广泛使用的开源LLM(即PRIMERA、LongT5和Llama-2)进行微调。总体而言,微调后的LLM在ROUGE-L上提升了9.89分(95%置信区间:8.94-10.81),在METEOR得分上提升了13.21分(95%置信区间:12.05-14.37),在CHRF得分上提升了15.82分(95%置信区间:13.89-16.44)。微调后的LongT5性能接近GPT-3.5的零样本设置。此外,一些较小的微调模型甚至在表现上优于较大的零样本模型。上述改进趋势也体现在人类评估和GPT4模拟评估中。我们的结果可用于指导针对需要特定领域知识的任务(如医学证据摘要)的模型选择。

关键词

引用

@article{arxiv.2408.00588,
  title  = {Closing the gap between open-source and commercial large language models for medical evidence summarization},
  author = {Gongbo Zhang and Qiao Jin and Yiliang Zhou and Song Wang and Betina R. Idnay and Yiming Luo and Elizabeth Park and Jordan G. Nestor and Matthew E. Spotnitz and Ali Soroush and Thomas Campion and Zhiyong Lu and Chunhua Weng and Yifan Peng},
  journal= {arXiv preprint arXiv:2408.00588},
  year   = {2024}
}