PathoScribe:将病理数据转化为可检索、临床可集成的动态图书馆的统一 LLM 驱动框架
计算机视觉与模式识别
2026-03-12 v2 人工智能
计算与语言
数字图书馆
信息检索
摘要
病理学是现代诊断和癌症护理的基础,但最宝贵的资产——数百万篇叙述性报告中编码的累积经验,仍 largely 不可访问。虽然机构正在快速数字化病理工作流程,但仅存储数据而不具有效检索和推理机制的风险是,将档案库转化为被动的数据存储库,其中机构知识虽存在,却无法在临床中有意义地影响患者护理。真正的进展不仅需要数字化,还需要病理学家在评估新诊断困境时能够实时检索类似病例。我们提出了 PathoScribe,一个统一的检索增强型大型语言模型(LLM)框架,旨在将静态病理档案库转化为可检索、具推理能力的动态图书馆。PathoScribe 实现了自然语言病例探索、自动化队列构建、临床问答、免疫组织化学(IHC)面板推荐以及在单一架构中的报告转换。该系统在70,000 份多机构手术病理报告上进行了评估,PathoScribe 实现了自然语言病例检索的完美 Recall@10,并证明了高质量检索依据推理(平均审阅者评分 4.56/5)。关键的是,该系统实现了从自由文本资格标准自动化队列构建,使研究就绪队列在平均 9.2 分钟内完成构建,与人类审阅者 91.3% 的一致性,且未错误排除任何符合条件的病例,相较于传统手动图表审核显著缩短了时间和成本。本工作为将数字病理档案库从被动存储系统转化为活跃的临床智能平台奠定了可扩展基础。
引用
@article{arxiv.2603.08935,
title = {PathoScribe: Transforming Pathology Data into a Living Library with a Unified LLM-Driven Framework for Semantic Retrieval and Clinical Integration},
author = {Abdul Rehman Akbar and Samuel Wales-McGrath and Alejadro Levya and Lina Gokhale and Rajendra Singh and Wei Chen and Anil Parwani and Muhammad Khalid Khan Niazi},
journal= {arXiv preprint arXiv:2603.08935},
year = {2026}
}