基于准则的医学推理在大语言模型中的训练与评估
计算机视觉与模式识别
2025-12-04 v1
摘要
机器学习在医学中实现早期预测近期显示突破性性能,但关注提高预测准确度的趋势导致忽视了医学从业者所需的可信解释。本文旨在教导大语言模型(LLM)在推理和预测过程中逐步遵循医学共识指南。由于医学共识指南普遍存在, verbalized 医学推理规则的实例化为电子健康记录(EHR)提供了微调LLM以学习共识规则及其可能例外情况的数据。共识规则还支持对模型推理过程的自动评估,包括关于从给定前提中正确且忠实地推导结论的推导正确性(评估正确性和忠实性)以及将预测值与真实世界测量值进行比较的值正确性。我们以复杂的Sepsis-3共识定义为例进行说明。我们的实验表明,小型微调模型在学习显式定义和包含共识定义的医学文本训练的相当更大的LLM上进行 one-shot 学习时表现更好。由于在特定医学领域的 verbalized 规则实例化进行的微调可实现在该领域未见病人数据上的几乎完美的推导正确性(包括规则和例外),早期预测的瓶颈并非分布外推力,,而是通过稀疏且不规则采样的临床变量预测到未来这一正交问题。我们表明,通过将时间序列预测模型的输出表示与LLM在多模态设置中集成可改善后者结果。
引用
@article{arxiv.2512.03837,
title = {Heatmap Pooling Network for Action Recognition from RGB Videos},
author = {Mengyuan Liu and Jinfu Liu and Yongkang Jiang and Bin He},
journal= {arXiv preprint arXiv:2512.03837},
year = {2025}
}
备注
Final Version of IEEE Transactions on Pattern Analysis and Machine Intelligence