通过跨人群比较问题从 LLM 中引出临床变量间的关联
机器学习
2026-05-08 v1
摘要
大语言模型 (LLM) 的训练数据包含广泛的生物医学文献,反映了来自许多不同患者人群的数据。我们研究如何可能恢复关于患者特征之间相关性和因果联系的信息,作为医疗决策制定的关键基石。为避免直接引出的陷阱,我们提出一种基于结构化比较问题的方法,具体为患者比较三元组问题。这与一个用于 LLM 表示的统计模型相结合,该模型在无法访问激活值或模型内部的情况下提供相关性估计。直观上,我们考虑基于第一个变量的 LLM 相似性决策如何受到为被评估患者之一提供第二个变量信息的影响。然后,我们引发提示级别的环境变化,以获得不同子人群的相关性估计,这使得不变因果预测 (ICP) 方法能够获得保守的候选父链接。我们在两个临床领域(慢性阻塞性肺疾病 (COPD) 和多发性硬化症 (MS))中演示了该方法。在提示的环境之间,引出的相关性是平滑、稳定且具有临床可解释性的,但以统计显著的方式变化,支持下游不变性测试,使得 ICP 提供了一小部分候选不变父链接。这些结果表明,通过三元组比较的间接引出可以从 LLM 中恢复有意义的关联结构,并提供了一条从隐式相关性与 LLM 回答模式一致的因果陈述的谨慎路径。
引用
@article{arxiv.2605.06335,
title = {Eliciting associations between clinical variables from LLMs via comparison questions across populations},
author = {Fabian Kabus and Kian Kordtomeikel and Thomas Brox and Heinz Wiendl and Daiana Stolz and Harald Binder},
journal= {arXiv preprint arXiv:2605.06335},
year = {2026}
}