开源大语言模型能否与商业模型竞争?在生物医学任务中的 GPT 模型 Few-Shot 性能探讨
计算与语言
2024-07-19 v1
摘要
商业大语言模型(如 OpenAI 的 GPT-4 用于 ChatGPT 和 Anthropic 的 Claude 3 Opus)在自然语言处理(NLP)基准测试中主导各个领域。新的开源替代方案如 Mixtral 8x7B 或 Llama 3 似乎正在缩小与之之间的差距,同时通常提供更高的吞吐量且成本更低。开源大语言模型也可以自托管,这使其在面向企业和临床应用时具有吸引力,因为敏感数据不应由第三方处理。在我们参与第 12 届 BioASQ 挑战中,探索了当前 GPT 模型Claude 3 Opus、GPT-3.5-turbo 和 Mixtral 8x7b 在零样本、few-shot 以及 QLoRa 微调中的性能。我们还探讨了将来自 Wikipedia 的额外相关知识添加到 LLM 的上下文窗口中是否会提高其性能。结果表明,Mixtral 8x7b 在 10-shot 设置下具有竞争力,无论是否进行微调,但在零-shot 设置下未能产生可用结果。QLoRa 微调和 Wikipedia 背景并未导致可衡量的性能提升。我们的结果表明,商业模型与开源模型在 RAG 设置中存在的性能差距主要出现在零-shot 设置中,通过收集 few-shot 示例即可在特定于领域的用例中实现。
关键词
引用
@article{arxiv.2407.13511,
title = {Can Open-Source LLMs Compete with Commercial Models? Exploring the Few-Shot Performance of Current GPT Models in Biomedical Tasks},
author = {Samy Ateia and Udo Kruschwitz},
journal= {arXiv preprint arXiv:2407.13511},
year = {2024}
}
备注
Version as accepted at the BioASQ Lab at CLEF 2024