中文

医学领域大型语言模型中的记忆现象:流行率、特征与影响

计算与语言 2026-01-27 v4 人工智能

摘要

大型语言模型 (LLM) 在医学领域已展现出巨大的潜力,许多研究通过持续预训练或微调医学数据来增强领域特定的准确性和安全性。然而,一个关键的开放问题仍然存在:大型语言模型记忆医学训练数据的程度有多大。记忆在 LLM 能够在领域适应期保留有价值的医学知识时是有益的。然而,它也引发了担忧。LLM 可能无意中复现敏感的临床内容(例如,患者特定的细节),并且过度记忆可能降低模型的可泛性,增加误诊风险,并可能提出不合理的建议。这些风险因 LLM 的生成性质而进一步放大, LLM 不仅会呈现记忆的内容,还会产生自信过度、误导性的输出,可能阻碍临床的采纳。本文我们present了一项关于医学领域大型语言模型记忆的研究,评估了其流行率(发生频率)、特征(记忆什么内容)、体积(记忆多少内容)以及潜在下游影响(记忆如何影响医学应用)。我们系统地分析了常见的适应情景:(1) 在医学语料库上进行持续预训练,(2) 在标准医学基准数据集上进行微调,以及 (3) 在真实世界的临床数据上进行微调,包括来自 Yale New Haven Health System 超过 13,000 条唯一住院记录。结果表明,记忆在所有适应情景中都很普遍,并且显著高于一般领域中报告的记忆水平。此外,记忆在持续预训练和微调期间具有不同的特征,并且是持久的:最高可达 87% 的记忆内容在进行新的医学任务微调后仍然保留。

关键词

引用

@article{arxiv.2509.08604,
  title  = {Memorization in Large Language Models in Medicine: Prevalence, Characteristics, and Implications},
  author = {Anran Li and Lingfei Qian and Mengmeng Du and Yu Yin and Yan Hu and Zihao Sun and Yihang Fu and Hyunjae Kim and Erica Stutz and Xuguang Ai and Qianqian Xie and Rui Zhu and Jimin Huang and Yifan Yang and Siru Liu and Yih-Chung Tham and Lucila Ohno-Machado and Hyunghoon Cho and Zhiyong Lu and Hua Xu and Qingyu Chen},
  journal= {arXiv preprint arXiv:2509.08604},
  year   = {2026}
}