中文

事实快速消退:评估大型语言模型对过时医学知识的记忆

计算与语言 2025-09-05 v1 人工智能

摘要

大型语言模型(LLMs)日益增长的能力显示出通过协助医学研究人员和医生来提升医疗保健的巨大潜力。然而,当医学建议随着新研究和进展而演变时,它们对静态训练数据的依赖是一个重大风险。当 LLMs 记忆了过时的医学知识时,它们可能会提供有害的建议,或在临床推理任务中失败。为了研究这个问题,我们引入了两个源自系统综述的新颖问答(QA)数据集:MedRevQA(包含 16,501 个涵盖一般生物医学知识的 QA 对)和 MedChangeQA(包含 512 个医学共识随时间改变的 QA 对子集)。我们在这些数据集上对八个杰出的 LLMs 进行了评估,结果显示所有模型都一致地依赖于过时的知识。我们还分析了过时的预训练数据和训练策略的影响以解释这一现象,并提出了未来的缓解方向,为开发更前沿和可靠的医学 AI 系统奠定了基础。

关键词

引用

@article{arxiv.2509.04304,
  title  = {Facts Fade Fast: Evaluating Memorization of Outdated Medical Knowledge in Large Language Models},
  author = {Juraj Vladika and Mahdi Dhaini and Florian Matthes},
  journal= {arXiv preprint arXiv:2509.04304},
  year   = {2025}
}

备注

Accepted to Findings of EMNLP 2025