中文

Argus:面向3D放射学报告生成的视觉-语言模型基准测试与增强

计算机视觉与模式识别 2025-02-26 v3 人工智能

摘要

自动放射学报告生成具有显著潜力,可简化放射科医生撰写报告的劳动密集型过程,特别是对于CT扫描等3D放射影像。尽管CT扫描对临床诊断至关重要,但与2D放射影像相比,其研究仍较少。迄今为止,尚无针对3D放射影像报告生成(3DRRG)的全面基准,也未充分研究视觉语言模型(VLM)在此背景下的最优训练策略,特别是在视觉编码器选择、视觉标记压缩和模型缩放方面。在这项工作中,我们做出了三项关键贡献。我们整理了CT-3DRRG,这是最大的公开可用的3D CT-报告数据集,为评估VLM在3DRRG上的性能建立了稳健且多样化的基准。此外,我们提出了一套全面的训练方案,用于构建高性能的3DRRG VLM,探索了视觉编码器预训练策略、视觉标记压缩以及数据和模型规模等关键因素。在这些发现的指导下,我们推出了Argus,一个最先进的VLM系列,在不同模型尺寸和输入3D医学图像分辨率下均实现了卓越性能,能够高效处理高达512×512×256512 \times 512 \times 256的高分辨率3D图像[^1]。

关键词

引用

@article{arxiv.2406.07146,
  title  = {Argus: Benchmarking and Enhancing Vision-Language Models for 3D Radiology Report Generation},
  author = {Che Liu and Zhongwei Wan and Yuqi Wang and Hui Shen and Haozhe Wang and Kangyu Zheng and Mi Zhang and Rossella Arcucci},
  journal= {arXiv preprint arXiv:2406.07146},
  year   = {2025}
}