中文

基于CT的颅内出血亚型分类中的零样态多模态大语言模型与监督式深度学习方法的比较研究

计算机视觉与模式识别 2025-10-28 v2

摘要

引言:及时识别非对比CT (NCCT) 中颅内出血 (ICH) 的亚型对于预后预测和治疗决策至关重要,但由于低对比度和边界模糊,仍面临挑战。本研究评估了零样态多模态大语言模型 (MLLMs) 与传统深度学习方法在ICH二分类和亚型分类中的性能。方法:我们利用RSNA提供的数据集,包含192个NCCT体数据。研究将各种MLLMs(包括GPT-4o、Gemini 2.0 Flash和Claude 3.5 Sonnet V2)与常规深度学习模型(包括ResNet50和Vision Transformer)进行比较。采用精心设计的提示词引导MLLMs完成ICH存在、亚型分类、定位和体积估计等任务。结果:结果表明,在ICH二分类任务中,传统深度学习模型综合 outperform MLLMs。对于亚型分类,MLLMs的表现也低于传统深度学习模型,Gemini 2.0 Flash实现了0.41的宏平均精确率和0.31的宏平均F1分数。结论:尽管MLLMs在交互式能力方面表现出色,但在ICH亚型分类中的整体准确率低于深度网络。然而,MLLMs通过语言交互提升了可解释性,表明其在医学影像分析中具有潜力。未来工作将聚焦于模型细化和开发更精确的MLLMs以提高其处理三维医学图像的性能。

关键词

引用

@article{arxiv.2505.09252,
  title  = {Zero-Shot Multi-modal Large Language Model v.s. Supervised Deep Learning: A Comparative Study on CT-Based Intracranial Hemorrhage Subtyping},
  author = {Yinuo Wang and Yue Zeng and Kai Chen and Cai Meng and Chao Pan and Zhouping Tang},
  journal= {arXiv preprint arXiv:2505.09252},
  year   = {2025}
}