中文

Brain3D:基于膨胀式视觉变换器的脑部报告自动化

计算机视觉与模式识别 2026-02-26 v1

摘要

当前医学视觉语言模型(VLM)使用 2D 切片近似处理三维脑部 MRI,导致无法获得用于准确神经放射学解释所需的空间上下文。我们开发了 Brain3D:一个用于从 3D 脑部肿瘤 MRI 自动生成放射学报告的分阶段视觉语言框架。我们的方法将预训练的 2D 医学编码器膨胀为原生 3D 架构,并通过三个阶段逐步对齐:对比 grounding、监督式投影热身和 LoRA 式语言专业化。与通用 3D 医学 VLM 不同,Brain3D 专为神经放射学设计,其中半球侧后性、肿瘤渗透模式和解剖定位是关键因素。在 468 名受试者(BraTS 病理案例加健康对照)上的评估显示,我们的模型在临床病理学 F1 分数上达到 0.951,而与强 2D 基线相比仅为 0.413,同时在健康扫描上保持完美的特异性。分阶段对齐至关重要:对比 grounding 建立了视觉-文本对应关系,投影热身稳定了条件,LoRA 适应将输出从冗长的描述转变为结构化的临床报告\footnote{我们的代码已公开获取,以确保透明度和可重复性}。

关键词

引用

@article{arxiv.2602.22098,
  title  = {Brain3D: Brain Report Automation via Inflated Vision Transformers in 3D},
  author = {Mariano Barone and Francesco Di Serio and Giuseppe Riccio and Antonio Romano and Marco Postiglione and Antonino Ferraro and Vincenzo Moscato},
  journal= {arXiv preprint arXiv:2602.22098},
  year   = {2026}
}