中文

用于医学影像质量控制的多模态人机协同:一种具有自适应数据集筛选与闭环评估的混合智能框架

计算与语言 2025-03-11 v1 计算机视觉与模式识别

摘要

医学影像质量控制(QC)对于准确诊断至关重要,然而传统的QC方法依然劳动密集且主观。为应对这一挑战,本研究建立了一个标准化的医学影像QC数据集与评估框架,系统地评估了大型语言模型(LLM)在图像质量评估和报告标准化方面的表现。具体而言,我们首先构建并匿名化了一个包含161张胸部X光(CXR)影像和219份CT报告的数据集用于评估。随后,对包括Gemini 2.0-Flash、GPT-4o和DeepSeek-R1在内的多个LLM进行了评估,以召回率、精确率和F1分数为指标检测技术错误与不一致之处。实验结果表明,Gemini 2.0-Flash在CXR任务中取得了90的Macro F1分数,展现出强大的泛化能力但细粒度性能有限。DeepSeek-R1在CT报告审计中表现出色,召回率达到62.23%,优于其他模型。然而,其蒸馏变体表现不佳,而InternLM2.5-7B-chat表现出最高的额外发现率,表明其检测范围更广但精度较低。这些发现凸显了LLM在医学影像QC中的潜力,其中DeepSeek-R1和Gemini 2.0-Flash展现了卓越的性能。

关键词

引用

@article{arxiv.2503.07032,
  title  = {Multimodal Human-AI Synergy for Medical Imaging Quality Control: A Hybrid Intelligence Framework with Adaptive Dataset Curation and Closed-Loop Evaluation},
  author = {Zhi Qin and Qianhui Gui and Mouxiao Bian and Rui Wang and Hong Ge and Dandan Yao and Ziying Sun and Yuan Zhao and Yu Zhang and Hui Shi and Dongdong Wang and Chenxin Song and Shenghong Ju and Lihao Liu and Junjun He and Jie Xu and Yuan-Cheng Wang},
  journal= {arXiv preprint arXiv:2503.07032},
  year   = {2025}
}