中文

3D-CT-GPT:通过大型视觉语言模型集成生成 3D 医学影像报告

计算机视觉与模式识别 2024-10-01 v1 人工智能

摘要

医学图像分析在现代放射诊断中起着关键作用,尤其鉴于医学影像数据的指数级增长。自动化报告生成系统的需求日益迫切。虽然先前的研究主要集中在使用机器学习和多模态语言模型处理 2D 医学图像,但由于数据稀缺和计算复杂性,针对 3D 医学图像的报告生成研究相对较少。本文引入了 3D-CT-GPT,一种专为从 3D CT 扫描(特别是胸部 CT)生成放射科报告而设计的基于视觉问答 (VQA) 的医学视觉语言模型。在公开和私有数据集上的大量实验表明,3D-CT-GPT 在报告准确性和质量方面显著优于现有方法。虽然目前的方法较少,包括部分开源的 CT2Rep 和开源的 M3D,但我们通过合适的数据转换和评估方法确保了公平比较。实验结果表明,3D-CT-GPT 提升了诊断准确性和报告连贯性,确立了其作为临床放射科报告生成的强大解决方案。未来的工作将聚焦于扩大数据集并进一步优化模型以提升其性能和适用性。

关键词

引用

@article{arxiv.2409.19330,
  title  = {3D-CT-GPT: Generating 3D Radiology Reports through Integration of Large Vision-Language Models},
  author = {Hao Chen and Wei Zhao and Yingli Li and Tianyang Zhong and Yisong Wang and Youlan Shang and Lei Guo and Junwei Han and Tianming Liu and Jun Liu and Tuo Zhang},
  journal= {arXiv preprint arXiv:2409.19330},
  year   = {2024}
}