PETAR:基于掩码感知的视觉-语言建模用于 PET 自动化报告生成中的局部发现
计算机视觉与模式识别
2025-12-02 v2 人工智能
机器学习
摘要
为 3D 脑 positron emission tomography(PET)自动生成报告是一个重要且具有挑战性的任务。PET 在肿瘤学中发挥关键作用,但自动化报告生成困难的原因在于整个体 3D 体积的复杂性、潜在临床发现的广泛范围以及注释数据集有限的可用性。为了解决这些挑战,我们引入了 PETARSeg-11K,即第一个大规模、公开可用的数据集,提供了 3D PET/CT 体积与自由文本放射学发现之间的 lesion 级别对应关系。它包含 11,356 条 lesion 描述配对的 3D 分割。其次,我们提出了 PETAR-4B,一个为 mask-aware、空间导向的 3D PET/CT 报告设计的 3D 视觉-语言模型。PETAR-4B 同时编码 PET、CT 和 3D lesion 分割掩码,使用 3D focal prompt 捕获 normally 小于 0.1% 体积中 lesion 的细粒度细节。使用自动化指标进行评估显示,PETAR-4B 在所有 2D 和 3D 基线上均显著优于。涉及五名医生的人类研究——首次针对自动化 PET 报告——确认了该模型的临床实用性并建立了自动化指标与专家判断之间的相关性。这项工作提供了一个基础数据集和一种新型架构,推动了 3D 医学视觉-语言理解在 PET 方面的发展。
引用
@article{arxiv.2510.27680,
title = {PETAR: Localized Findings Generation with Mask-Aware Vision-Language Modeling for PET Automated Reporting},
author = {Danyal Maqbool and Changhee Lee and Zachary Huemann and Samuel D. Church and Matthew E. Larson and Scott B. Perlman and Tomas A. Romero and Joshua D. Warner and Meghan Lubner and Xin Tie and Jameson Merkow and Junjie Hu and Steve Y. Cho and Tyler J. Bradshaw},
journal= {arXiv preprint arXiv:2510.27680},
year = {2025}
}