中文

RareAlert:对齐异构大语言模型推理用于罕见疾病早期风险筛查

人工智能 2026-01-27 v1

摘要

漏诊和延迟诊断仍然是罕见疾病护理中的主要挑战。在初次临床就诊时,医生仅凭有限的信息在高不确定性下评估罕见疾病风险。如果在此阶段未能识别出高危患者,通常不会启动针对性的诊断测试,从而导致漏诊。现有的初级保健分诊流程在结构上不足以在初次临床表现时可靠地识别罕见疾病患者,需要普遍筛查以减少诊断延迟。在此我们提出 RareAlert,一种早期筛查系统,可从常规可用的初级就诊信息中预测患者层面的罕见疾病风险。RareAlert 整合了由十个 LLM 生成的推理,使用机器学习对这些信号进行校准和加权,并将对齐后的推理蒸馏为单一的可本地部署模型。为了开发和评估 RareAlert,我们策划了 RareBench,这是一个包含 158,666 个病例的真实世界数据集,涵盖 33 个 Orphanet 疾病类别和超过 7,000 种罕见疾病,包括罕见和非罕见表现。结果表明,罕见疾病识别可以被重新概念化为应用于一般患者群体的普遍不确定性解决过程。在独立测试集上,RareAlert(一个使用校准后的推理信号训练的基于 Qwen3-4B 的模型)实现了 0.917 的 AUC,优于最佳的机器学习集成和所有评估的 LLM,包括 GPT-5、DeepSeek-R1、Claude-3.7-Sonnet、o3-mini、Gemini-2.5-Pro 和 Qwen3-235B。这些发现证明了 LLM 医学推理的多样性,以及在高度不确定的临床任务中对齐此类推理的有效性。通过将校准后的推理纳入单一模型,RareAlert 实现了准确、保护隐私且可扩展的罕见疾病风险筛查,适合大规模本地部署。

关键词

引用

@article{arxiv.2601.18132,
  title  = {RareAlert: Aligning heterogeneous large language model reasoning for early rare disease risk screening},
  author = {Xi Chen and Hongru Zhou and Huahui Yi and Shiyu Feng and Hanyu Zhou and Tiancheng He and Mingke You and Li Wang and Qiankun Li and Kun Wang and Weili Fu and Kang Li and Jian Li},
  journal= {arXiv preprint arXiv:2601.18132},
  year   = {2026}
}

备注

28 page, 3 figures