中文

课程驱动的 3D CT 报告生成:基于无语言视觉嫁接与区域约束压缩

计算机视觉与模式识别 2026-03-25 v1 人工智能

摘要

从 3D 计算机断层扫描(CT)体积自动生成放射学报告具有挑战性,原因包括极端的序列长度、严重的类别不平衡,以及大型语言模型(LLM)倾向于忽略视觉标记而偏好语言先验。我们提出了 Ker-VLJEPA-3B,一个用于从胸部 CT 体积生成自由文本报告的四阶段课程学习框架。分阶段训练课程逐步使 Llama 3.2 3B 解码器将其输出锚定在来自冻结自监督编码器的视觉特征上。我们的视觉骨干(LeJEPA ViT-Large)通过无标签 CT 上的自监督联合嵌入预测进行训练,无需文本监督。与对比学习模型(CLIP、BiomedCLIP)不同,这种无语言骨干产生了模态纯净的表示。视觉-语言对齐被推迟到课程的桥接和生成阶段。这种模态无关的设计可以将任何自监督编码器集成到 LLM 中,而无需在基础训练期间配对文本。方法学创新包括:(1)将切片嵌入压缩为 32 个空间锚定视觉标记的区域约束交叉注意力;(2)LLM 嵌入的 PCA 白化;(3)消除后验坍缩的仅阳性发现策略;(4)迁移投影权重的温桥初始化;以及(5)防止灾难性遗忘的选择性交叉注意力冻结与弹性权重巩固。在 CT-RATE 基准(2,984 个验证体积,18 个类别)上评估,Ker-VLJEPA-3B 实现了宏 F1 为 0.429,超越最先进方法(U-VLM,宏 F1 = 0.414)3.6%,并通过阈值优化达到 0.448(+8.2%)。消融研究确认 56.6% 的生成质量来自患者特定的视觉内容。代码和权重可获取。

关键词

引用

@article{arxiv.2603.23308,
  title  = {Curriculum-Driven 3D CT Report Generation via Language-Free Visual Grafting and Zone-Constrained Compression},
  author = {V. K. Cody Bumgardner and Mitchell A. Klusty and Mahmut S. Gokmen and Evan W. Damron},
  journal= {arXiv preprint arXiv:2603.23308},
  year   = {2026}
}

备注

10 pages, 2 figures