大型语言模型缺乏医学知识的时间感知能力
机器学习
2026-05-14 v1 计算与语言
摘要
目前用于评估大型语言模型(LLM)医学知识的方法主要基于无时间维度的考试式基准测试,而现实中,医学知识是内在动态的,随着新证据浮现和治疗获批不断演变。因此,在没有时间背景的情况下评估医学知识,可能无法全面评估 LLM 是否能准确推理关于时间特定医学知识的问题。此外,大多数医学数据是历史数据,要求模型不仅要记得正确的知识,还要知道该知识何时是正确的。为弥合这一差距,我们构建了 TempoMed-Bench,这是第一个在医学领域通过演化指南知识评估 LLM 时间感知能力的基准测试。基于 TempoMed-Bench,我们的评估分析首先揭示了 LLM 在医学知识方面缺乏时间感知能力的关键发现:(1) 针对最新医学知识的模型表现呈现渐进的线性下降,而非尖锐的知识截断行为,这表明参数化的医学知识并非严格受知识截止日期限制;(2) LLM 在回忆过时历史医学知识方面持续困难,准确率仅为最新推荐准确率的 25.37%-53.89%,表明训练期间可能存在知识遗忘效应;(3) LLM 常表现出时间上的不一致行为,其中预测在相邻年份间不规则波动。我们还指出,时间感知问题是一种难以轻易通过集成智能体搜索工具来解决的挑战(-3.15%至 -14.14%)。本工作突显了一个重要且尚未被充分探索的挑战,并为开发能够更好地编码时间特定医学知识的 LLM 提供了动力。
引用
@article{arxiv.2605.13045,
title = {Large Language Models Lack Temporal Awareness of Medical Knowledge},
author = {Zihan Guan and Qiao Jin and Guangzhi Xiong and Fangyuan Chen and Mengxuan Hu and Qingyu Chen and Yifan Peng and Zhiyong Lu and Anil Vullikanti},
journal= {arXiv preprint arXiv:2605.13045},
year = {2026}
}
备注
35 pages, 18 figures