大语言模型的医学可解释性与知识图谱
机器学习
2026-02-24 v2 人工智能
摘要
我们 presenting 对大型语言模型 (LLM) 在医学领域可解释性的系统性研究。我们研究了 LLMs 如何通过四种不同的可解释性技术来表示和处理医学知识:(1) 中间激活的 UMAP 投影,(2) 相对于模型权重的梯度-based saliency,(3) 层级切除/移除和 (4) 激活修补。我们展示了五个 LLMs 的知识图谱,这些图谱在粗糙分辨率下显示了患者年龄、医学症状、疾病和药物知识在模型中的存储位置。特别是对于 Llama3.3-70B,我们发现大多数医学知识是在模型的前半部分处理的。此外,我们发现了若干有趣的现象:(i) 年龄在模型中间层中常以非线性且有时是 discontinuous 方式编码,(ii) 疾病进展表示在模型的某些层中呈非单调和循环形式,(iii) 在 Llama3.3-70B 中,药物更倾向于按医学专科划分而非按作用机制聚类,尤其是对于 Llama3.3-70B 和 Gemma3-27B,以及 (iv) Gemma3-27B 和 MedGemma-27B 的激活在模型的中间层中会崩溃,但在最终层中会恢复。这些结果可指导未来针对医学任务进行的精细调优、遗忘或去偏 research,通过建议这些技术应在模型的哪些层中应用来实现。
引用
@article{arxiv.2510.11390,
title = {Medical Interpretability and Knowledge Maps of Large Language Models},
author = {Razvan Marinescu and Victoria-Elisabeth Gruber and Diego Fajardo},
journal= {arXiv preprint arXiv:2510.11390},
year = {2026}
}
备注
29 pages, 34 figures, 5 tables