中文

学习毒理学中的诊断推理以支持决策

计算与语言 2026-04-01 v1

摘要

急性多物质中毒需要在相当大的不确定性下做出快速、挽救生命的决策,因为临床医生必须依赖不完整的摄入细节和非特异性症状。在这种混乱环境中进行有效的诊断推理,需要融合非结构化的非医学叙述(例如急救人员现场描述和不可靠的患者自述或已知病史)与结构化医学数据(如生命体征)。虽然大语言模型(LLMs)在处理此类异构输入方面展现出潜力,但它们在此场景下表现不佳,往往仅依赖患者病史的简单基线方法反而更优。为解决这一问题,我们提出了 DeToxR(用于毒理学的决策支持与推理),这是强化学习(RL)在急诊毒理学中的首个应用。我们设计了一个鲁棒的数据融合引擎,基于经组相对策略优化(GRPO)微调的大语言模型,对 14 种物质类别进行多标签预测。我们利用临床性能奖励直接优化模型的推理过程。通过将多标签一致性指标作为奖励信号,模型明确地受到惩罚缺失共摄入物质和幻觉性虚构毒物。我们的模型显著优于其未适配的基础大语言模型和监督学习基线。此外,在临床验证研究中,模型在识别正确毒物方面表现出超越专家毒理学家的临床优势(Micro-F1:0.644 对比 0.473)。这些结果展示了经强化学习对齐的大语言模型在合成非结构化临床前叙述与结构化医学数据以支持高风险环境中的决策方面的潜力。

关键词

引用

@article{arxiv.2603.29608,
  title  = {Learning Diagnostic Reasoning for Decision Support in Toxicology},
  author = {Nico Oberländer and David Bani-Harouni and Tobias Zellner and Nassir Navab and Florian Eyer and Matthias Keicher},
  journal= {arXiv preprint arXiv:2603.29608},
  year   = {2026}
}