用于解释医疗预测中黑箱大语言模型的代理建模
计算与语言
2026-04-24 v2 人工智能
机器学习
摘要
在庞大数据集上训练的大型语言模型 (LLM) 在其参数中编码了广泛的现实世界知识,但其黑箱性质掩盖了这种编码的机制和程度。代理建模使用简化模型来近似复杂系统,可以为黑箱模型提供更好的可解释性。我们提出一个代理建模框架,用于定量解释 LLM 编码的知识。对于源自领域知识的特定假设,该框架通过在一系列全面的模拟场景中进行广泛提示,使用可观测元素(输入-输出对)来近似潜在的 LLM 知识空间。通过在医疗预测中的概念验证实验,我们证明了我们的框架在揭示 LLM 对每个输入变量与输出相关程度的“感知”方面的有效性。特别是,考虑到 LLM 可能延续其训练数据中嵌入的不准确性和社会偏见的担忧,我们使用该框架的实验定量揭示了 LLM 编码知识中既存在与既定医学知识相矛盾的关联,也存在被科学驳斥的种族假设的持续存在。通过披露这些问题,我们的框架可以充当红旗指示器,以支持这些模型的安全可靠应用。
引用
@article{arxiv.2604.20331,
title = {Surrogate modeling for interpreting black-box LLMs in medical predictions},
author = {Changho Han and Songsoo Kim and Dong Won Kim and Leo Anthony Celi and Jaewoong Kim and SungA Bae and Dukyong Yoon},
journal= {arXiv preprint arXiv:2604.20331},
year = {2026}
}