中文

事实还是猜测?评估大型语言模型的医学知识——结构化单跳判断

计算与语言 2025-08-20 v2 机器学习

摘要

大型语言模型(LLM)已在 various 下游任务领域得到广泛应用。然而,其直接记忆和应用事实医学知识的能力仍未得到充分探索。大多数现有医学 QA 基准评估的是复杂推理或多跳推理,难以隔离 LLM 的内在医学知识与其推理能力。鉴于医学应用的高风险性,其中错误信息可能导致严重后果,评估 LLM 的事实性以保留医学知识显得至关重要。为此,我们引入了医学知识判断数据集(MKJ),该数据集源自统一医学语言系统(UMLS),即来自标准化生物医学词汇表和知识图谱的综合性知识库。通过二元分类框架,MKJ 评估 LLM 对基本医学事实的把握,通过让其评估简洁的单跳声明的有效性,从而实现对其知识保留能力的直接测量。我们的实验表明,LLM 在准确记忆医学事实方面存在困难,其表现在语义类型之间存在显著差异,且在不常见医学疾病方面表现尤为薄弱。此外,LLM 显示出较差的校准能力,往往对错误答案过于自信。为缓解这些问题,我们探索了检索增强生成,证明其在提高事实准确性和减少医学决策中的不确定性方面的有效性。

关键词

引用

@article{arxiv.2502.14275,
  title  = {Fact or Guesswork? Evaluating Large Language Models' Medical Knowledge with Structured One-Hop Judgments},
  author = {Jiaxi Li and Yiwei Wang and Kai Zhang and Yujun Cai and Bryan Hooi and Nanyun Peng and Kai-Wei Chang and Jin Lu},
  journal= {arXiv preprint arXiv:2502.14275},
  year   = {2025}
}

备注

15 pages, 11 figures