在生物医学问答任务中,较小的开放权重 LLM 是否正在缩小与专有模型的差距?
计算与语言
2025-09-24 v1 信息检索
机器学习
摘要
大语言模型(LLM)的开放权重版本正在快速进步,像 DeepSeek-V3 这样的最先进模型现在的表现已与专有 LLM 相当。这一进展引出了一个问题:小型开放权重 LLM 是否能够有效替代更大的闭源模型。我们特别关注生物医学问答的背景,这是我们通过参加 BioASQ 挑战赛 Task 13B Phase B 所探索的领域。在这项工作中,我们将几个开放权重模型与表现最佳的系统(如 GPT-4o、GPT-4.1、Claude 3.5 Sonnet 和 Claude 3.7 Sonnet)进行了比较。为了增强问答能力,我们使用了多种技术,包括基于嵌入距离检索最相关的片段、上下文学习和结构化输出。对于某些提交,我们利用集成方法来利用不同模型为精确答案问题生成的多样化输出。我们的结果表明,开放权重 LLM 与专有模型相当。在某些情况下,开放权重 LLM 甚至超过了其闭源对应模型,特别是在应用集成策略时。所有代码均公开于 https://github.com/evidenceprime/BioASQ-13b。
引用
@article{arxiv.2509.18843,
title = {Are Smaller Open-Weight LLMs Closing the Gap to Proprietary Models for Biomedical Question Answering?},
author = {Damian Stachura and Joanna Konieczna and Artur Nowak},
journal= {arXiv preprint arXiv:2509.18843},
year = {2025}
}
备注
CLEF 2025 Working Notes, 9-12 September 2025, Madrid, Spain