RDMA:面向电子健康记录中稀有疾病的经济型代理驱动挖掘
机器学习
2026-05-14 v2 人工智能
计算与语言
多智能体系统
摘要
稀有疾病影响每 10 位美国人中的 1 位,但仍在临床记录中系统性地未被记录。基于 ICD 的系统无法捕捉其广泛性,超过 50% 的 Orphanet 编码缺乏直接的 ICD 映射,仅有 2.2% 的 HPO 编码与 ICD 编码匹配,导致患者人群不可见并延迟诊断。从非结构化临床笔记中挖掘可为直接路径,但实际笔记长度长、噪声多且缩写密集,且有限的标注使微调难以实现,亟需能够在无任务特定训练的情况下进行泛化的方法。我们提出了稀有疾病挖掘代理(RDMA),这是一个代理化框架,为较小的量化 LLM 配备了缩写解析、隐式表型推理和针对 Orphanet 与 HPO 的本体对齐工具。RDMA 在不同数据特征下的基准测试中显著优于微调和 RAG 基线,无需任何任务特定训练。小型量化模型实现最高性能,将推理成本降低最高可达 10 倍,将本地硬件成本降低最高可达 17 倍,使可在标准硬件上进行私密部署,无需基于云端的 PHI 暴露。RDMA 的不确定性标志机制进一步减少了专家标注负担,同时保持一致性质,支持临床实践中可扩展的稀有疾病文档。项目已在 https://github.com/jhnwu3/RDMA 提供。
引用
@article{arxiv.2507.15867,
title = {RDMA: Cost Effective Agent-Driven Rare Disease Mining from Electronic Health Records},
author = {John Wu and Adam Cross and Jimeng Sun},
journal= {arXiv preprint arXiv:2507.15867},
year = {2026}
}