中文

BIT.UA-AAUBS 在 ArchEHR-QA 2026:通过提示评估低资源 QA 中的开源和专有大语言模型

计算与语言 2026-05-06 v1

摘要

本文呈现了 BIT.UA 和 AAUBS 两组在 ArchEHR-QA 2026 共享任务中的联合参与,该任务聚焦于低资源环境下的临床问答与证据 grounding。由于缺乏训练数据以及医疗领域固有的严格数据隐私约束(如 GDPR),我们在不进行权重更新的情况下探讨大语言模型(LLM)的能力。我们评估了多个最先进的专有模型和可本地部署的开源替代方案,采用各种提示工程策略,包括任务分解、链式思维和情境学习。此外,我们探索了多数投票和 LLM 作为评判器的集成技术以最大化预测鲁棒性。我们的结果表明,尽管专有模型对提示变体表现出强大的鲁棒性,但领域适应的开源模型(如 MedGemma 3 27B)在正确的提示搭配下实现了高度具竞争力的性能。总体而言,我们的基于提示的方法证明极为有效,在子任务 4(证据引用对齐)中获得第 1 名,在子任务 3(患者友好答案生成)中获得第 3 名。所有代码、结果和提示均可在我们的 GitHub 仓库 https://github.com/bioinformatics-ua/ArchEHR-QA-2026 上获取。

关键词

引用

@article{arxiv.2605.03618,
  title  = {BIT.UA-AAUBS at ArchEHR-QA 2026: Evaluating Open-Source and Proprietary LLMs via Prompting in Low-Resource QA},
  author = {Richard A. A. Jonker and Alexander Christiansen and Alexandros Maniatis and Rúben Garrido and Rogério Braunschweiger de Freitas Lima and Roman Jurowetzki and Sérgio Matos},
  journal= {arXiv preprint arXiv:2605.03618},
  year   = {2026}
}

备注

14 pages, 7 figures, 4 tables, accepted at CL4Health@LREC 2026