纵向骨髓瘤记录上的智能体临床推理:基于专家共识的回顾性评估
人工智能
2026-04-28 v1 计算与语言
摘要
多发性骨髓瘤在数年至数十年的时间内通过连续的治疗线进行管理,每个决策都取决于分布在数十到数百份异构临床文档中的累积疾病史。基于 LLM 的系统能否在接近专家一致的水平上综合这些证据尚未得到证实。在一所三级中心(2001-2026)接受治疗的 811 名骨髓瘤患者的纵向临床记录上进行了回顾性评估,涵盖 44,962 份文档和 1,334,677 个实验室数值,并在 MIMIC-IV 上进行了外部验证。在来自 48 个模板、三个复杂度级别的 469 个患者-问题对上,将智能体推理系统与单次检索增强生成(RAG)、迭代 RAG 和全上下文输入进行了比较。参考标签来自四名肿瘤学家的双重标注并由资深血液学家裁决。迭代 RAG 和全上下文输入收敛于一个共同的上限(75.4% vs 75.8%,p = 1.00)。智能体系统达到了 79.6% 的一致性(95% CI 76.4-82.8),超过了两个基线(+3.8 和 +4.2 pp;p = 0.006 和 0.007)。增益随问题复杂度而增加,在基于标准的综合上达到 +9.4 pp(p = 0.032),并随记录长度而增加,在最高十分位数(n = 10)中达到 +13.5 pp。系统错误率(12.2%)与专家分歧率(13.6%)相当,但严重程度呈现倒置:57.8% 的系统错误具有临床显著性,而专家分歧中这一比例为 18.8%。智能体推理是唯一超过共同上限的方法,其增益集中在最复杂的问题和最长的记录上。残余系统错误更大的临床后果表明,在这些发现转化为患者获益之前,需要在常规护理中进行前瞻性评估。
引用
@article{arxiv.2604.24473,
title = {Agentic clinical reasoning over longitudinal myeloma records: a retrospective evaluation against expert consensus},
author = {Johannes Moll and Jannik Lübberstedt and Christoph Nuernbergk and Jacob Stroh and Luisa Mertens and Anna Purcarea and Christopher Zirn and Zeineb Benchaaben and Fabian Drexel and Hartmut Häntze and Anirudh Narayanan and Friedrich Puttkammer and Andrei Zhukov and Jacqueline Lammert and Sebastian Ziegelmayer and Markus Graf and Marion Högner and Marcus Makowski and Florian Bassermann and Lisa C. Adams and Jiazhen Pan and Daniel Rueckert and Krischan Braitsch and Keno K. Bressem},
journal= {arXiv preprint arXiv:2604.24473},
year = {2026}
}