大语言模型中基于指南的医学推理的训练与评估
计算与语言
2025-12-04 v1
摘要
医学早期预测的机器学习最近展现了突破性的性能,然而,对提高预测准确性的关注导致了对忠实解释的忽视,而忠实解释是获得医学从业者信任所必需的。本文的目标是教会大语言模型(LLMs)在其推理和预测过程中逐步遵循医学共识指南。由于共识指南在医学中无处不在,将口头化的医学推理规则实例化到电子健康记录中,为微调LLMs以学习许多医学领域的共识规则及其可能的例外提供了数据。共识规则还使得能够自动评估模型的推理过程,包括其推导正确性(评估从给定前提正确且忠实地推导出结论)和数值正确性(将预测值与现实测量值进行比较)。我们使用复杂的Sepsis-3共识定义来示例我们的工作。我们的实验表明,小型微调模型优于一次性学习明显更大的LLMs(这些LLMs被提示显式定义)以及在包括共识定义的医学文本上训练的模型。由于在特定医学领域的口头化规则实例上进行微调,在该领域未见过的患者数据上,规则(和例外)的推导正确性几乎完美,因此早期预测的瓶颈不是分布外泛化,而是通过预测稀疏且不规则采样的临床变量来面向未来的泛化这一正交问题。我们表明,通过在多模态设置中将时间序列预测模型的输出表示与LLM集成,可以改善后者的结果。
引用
@article{arxiv.2512.03838,
title = {Training and Evaluation of Guideline-Based Medical Reasoning in LLMs},
author = {Michael Staniek and Artem Sokolov and Stefan Riezler},
journal= {arXiv preprint arXiv:2512.03838},
year = {2025}
}