中文

探究 LLM 在医学长上下文理解中的能力

计算与语言 2026-01-16 v2

摘要

本研究是首次考察 LLM 超越 MCQA 范围内,对长上下文 (LC) 的医学问答 (QA) 理解能力。我们的全面方法考虑了基于内容包含不同规模和相关性的各种设置、不同能力的 LLM 模型以及各种数据集跨任务形式。我们揭示了模型大小效应及其局限性、底层记忆问题以及推理模型的优势,同时展示了充分利用患者完整长上下文的价值和挑战。重要的是,我们检验了检索增强生成 (RAG) 对医学 LC 理解的影响,展示了单文档和多文档 QA 数据集中的最佳设置。我们采用多层面方法揭示了一些评估方面,发现常见指标挑战。我们的定量分析揭示了 RAG 在某些具有挑战性的案例中表现突出的同时,在仍显示出需要时间推理情境中局限性的案例中仍存在局限。

关键词

引用

@article{arxiv.2510.18691,
  title  = {Investigating LLM Capabilities on Long Context Comprehension for Medical Question Answering},
  author = {Feras AlMannaa and Talia Tseriotou and Jenny Chim and Maria Liakata},
  journal= {arXiv preprint arXiv:2510.18691},
  year   = {2026}
}