中文

更好的Token成就更好的3D:推进3D医学影像中的视觉-语言建模

计算机视觉与模式识别 2025-10-24 v1

摘要

近期,3D医学影像视觉-语言建模的进展得益于大规模配对自由文本报告的计算机断层扫描(CT)语料库、更强的架构以及强大的预训练模型。这催生了自动报告生成和文本条件3D图像合成等应用。然而,当前方法在处理高分辨率、长序列体数据时面临挑战:对比预训练常导致视觉编码器与临床语言对齐不佳,而逐切片的分词化会模糊精细解剖结构,降低下游任务的诊断性能。我们提出了BTB3D(Better Tokens for Better 3D),一种因果卷积编码器-解码器,它统一了2D和3D的训练与推理,同时生成紧凑且频率感知的体素Token。一个三阶段训练课程使其能够进行(i)局部重建、(ii)重叠窗口分块和(iii)长上下文解码器精炼,在此过程中,模型从短切片片段中学习,却能泛化到超过300个切片的扫描,且无需额外内存开销。BTB3D在两个关键任务上达到了新的最先进水平:在报告生成任务中,相比CT2Rep、CT-CHAT和Merlin,它提升了BLEU分数,并将临床F1分数提高了40%;在文本到CT合成任务中,相比GenerateCT和MedSyn,它将FID降低了75%,并将FVD减半,生成了解剖结构一致的512*512*241体数据。这些结果证实,精确的三维分词化,而非仅仅更大的语言骨干网络,对于3D医学影像中可扩展的视觉-语言建模至关重要。代码库地址:https://github.com/ibrahimethemhamamci/BTB3D

关键词

引用

@article{arxiv.2510.20639,
  title  = {Better Tokens for Better 3D: Advancing Vision-Language Modeling in 3D Medical Imaging},
  author = {Ibrahim Ethem Hamamci and Sezgin Er and Suprosanna Shit and Hadrien Reynaud and Dong Yang and Pengfei Guo and Marc Edgar and Daguang Xu and Bernhard Kainz and Bjoern Menze},
  journal= {arXiv preprint arXiv:2510.20639},
  year   = {2025}
}

备注

NeurIPS 2025