MedScribe:基于智能体工作流程的临床导向 CT 报告生成
计算机视觉与模式识别
2026-05-05 v1
摘要
视觉语言模型 (VLM) 在自动化放射学报告生成方面显示出潜力,但现有方法依赖于体数据全局嵌入压缩,常导致幻觉发现并在 3D CT 成像中受限于解剖定位。我们引入 MedScribe,一个以假设驱动框架,将报告生成重新表述为迭代证据获取过程,而非单次编码任务。MedScribe 将建模报告作为顺序决策过程,大型语言模型动态调用特定病灶诊断工具,以提取局部体数据特征。这些结构化特征用于查询与病灶特定文本证据对齐的多维检索空间。通过在合成前显式累积定量证据,该框架强制进行细粒度定位,减少不受支持的主张。无需任务特定微调,MedScribe 在 CT-RATE 和 RadChestCT 上的临床准确性、事实一致性和可解释性均优于最先进的 2D 和 3D VLM,展示了假设驱动推理在可靠医学图像报告中的价值。
引用
@article{arxiv.2605.01779,
title = {MedScribe: Clinically Grounded CT Reporting through Agentic Workflows},
author = {Giuseppe A. Orlando and Paolo Papotti and Maria A. Zuluaga and Olivier Humbert and Marco Lorenzi},
journal= {arXiv preprint arXiv:2605.01779},
year = {2026}
}