中文

LLM Ensemble for RAG:生物ASQ 挑战中零样本问答中上下文长度的作用

计算与语言 2025-09-11 v1

摘要

生物医学问答(QA)由于需要精准解读来自庞大、复杂且快速演化语料库中专业知识,面临着显著挑战。本文探讨了如何利用大语言模型(LLM)进行信息检索(IR),以及零样本模型集合能否在特定领域的 Yes/No 问答任务上达到最新性能。我们在 BioASQ 挑战任务上评估了该方法,表明集合模型能够超越单个 LLM,并在某些情况下与甚至超过领域微调系统,同时保持通用性,无需昂贵的微调或标记数据。该方法聚合来自多个 LLM 变体(包括 Anthropic 和 Google 的模型)的输出,以综合更准确和稳健的答案。此外,我们的研究突显了上下文长度与性能之间的关系:虽然扩大的上下文旨在提供有价值的证据,但同时也会导致信息稀释和模型迷失。这些发现强调了在生物医学 QA 系统中,检索增强生成(RAG)方法中的 IR 仍是关键基础。精确、聚焦的检索对于确保 LLM 在生成答案时保持在相关信息边界内至关重要。我们的结果表明,集合化的零样本方法配合有效的 RAG 流程,构成了生物医学问答中实用且可扩展的领域微调系统的替代方案。

关键词

引用

@article{arxiv.2509.08596,
  title  = {LLM Ensemble for RAG: Role of Context Length in Zero-Shot Question Answering for BioASQ Challenge},
  author = {Dima Galat and Diego Molla-Aliod},
  journal= {arXiv preprint arXiv:2509.08596},
  year   = {2025}
}

备注

CEUR-WS, CLEF2025