RAPTOR+:一个视觉锚定的视觉-语言框架,用于提高自动化癌症 referrals 处理中的临床可信度和可审计性
计算机视觉与模式识别
2026-05-26 v1
摘要
紧急疑似结直肠癌(CRC) referrals 由于半结构化临床文件常需人工审核和转录,导致运营瓶颈。原始 RAPTOR 系统使用大型语言模型进行结构化提取,但依赖独立的 OCR 阶段,易受手写体、布局变异及视觉证据链丢失影响。我们提出 RAPTOR+,一种多模态扩展版本,使用视觉-语言模型(VLM)进行端到端 referrals 理解。我们评估了微调的 VLM、商业和开源零-shot VLM 以及原始的 OCR 管道,针对 223 份临床精选的 CRC 紧急 referrals 表格进行测试。我们还引入一种基于锚定的评估框架,衡量提取准确性和证据局部化。结果显示零-shot 模型存在明显的锚定差距。Gemini 2.5 Flash 达到 92.6% 的阅读准确率,但仅 1.2% 的严格安全性。相比之下,微调的 Qwen3-VL-8B 达到 96.1% 的阅读准确率和 60.6% 的严格安全性,显著改进了可验证的证据锚定。这些发现表明,针对特定任务的微调对于可靠且可审计的临床文档理解至关重要。RAPTOR+ 使提取的 referrals 决策可链接到视觉证据,支持更安全、更高效的癌症 referrals 分流。
引用
@article{arxiv.2605.25956,
title = {RAPTOR+: A Visually Grounded Vision-Language Framework to Improve Clinical Trust and Auditability in Automated Cancer Referral Processing},
author = {Sofiat Abioye and Ufaq Khan and Shazad Ashraf and Anusha Jose and Benjamin Wallace and William Poulett and Adam Byfield and Lukman Akanbi and Muhammad Bilal},
journal= {arXiv preprint arXiv:2605.25956},
year = {2026}
}
备注
12 pages 4 figures