中文

MedRegion-CT:面向综合性 3D CT 报告生成的区域聚焦型多模态大语言模型

图像与视频处理 2025-07-01 v1 计算机视觉与模式识别

摘要

近期 RadGenome-Chest CT 的发布显著推动了 CT 基报告生成。然而,现有方法主要关注全局特征,难以捕获区域特定细节,可能导致某些异常被忽视。为此,本文提出 MedRegion-CT, 一个面向综合性 3D CT 报告生成的区域聚焦型多模态大语言模型框架,包含三个关键创新。首先,我们引入区域代表 (R2R^2) 标记池,利用 2D 预训练视觉模型高效提取 3D CT 特征。该方法生成代表整体切片特征的全局标记和突出目标区域的区域标记,使 MLLM 能有效处理全面信息。其次,通用分割模型生成伪掩码,后续通过掩码编码器提取区域中心特征。这使 MLLM 能专注于临床相关区域,使用六个预定义区域掩码。最后,我们利用分割结果提取患者特定属性,包括器官大小、直径和位置。这些被转换为文本提示,丰富 MLLM 对患者特定情境的理解。为确保严格评估,我们在 RadGenome-Chest CT 上的报告生成基准实验表明,MedRegion-CT 实现了最先进的性能,在自然语言生成质量和临床相关性方面超越现有方法,同时保持可解释性。我们的框架代码已公开。

关键词

引用

@article{arxiv.2506.23102,
  title  = {MedRegion-CT: Region-Focused Multimodal LLM for Comprehensive 3D CT Report Generation},
  author = {Sunggu Kyung and Jinyoung Seo and Hyunseok Lim and Dongyeong Kim and Hyungbin Park and Jimin Sung and Jihyun Kim and Wooyoung Jo and Yoojin Nam and Namkug Kim},
  journal= {arXiv preprint arXiv:2506.23102},
  year   = {2025}
}

备注

14 pages, 5 figures, submitted to ICCV 2025