T3D:通过学习多视角视觉一致性推进 3D 医学视觉-语言预训练
计算机视觉与模式识别
2025-02-26 v3 计算与语言
机器学习
图像与视频处理
摘要
虽然 3D 视觉自监督学习在捕获视觉表示方面展现出可喜的成果,但它忽略了来自放射学报告的临床知识。同时,由于缺乏大规模、公开可用的 3D 医学图像-报告数据集,3D 医学视觉-语言预训练仍待深入探索。为了弥合这一差距,我们引入了 **CT-3DVLP**,这是首个也是最大的**公开** 3D 体数据-报告数据集,为 3D MedVLP 研究建立了全面的基准。同时,我们提出了 **T3D** 框架,该框架超越了直接将体数据与报告配对但忽略局部视觉表示的朴素 CLIP 风格对齐,从而增强了 3D MedVLP。相反,我们引入了**文本感知多视角对齐**,这是一种新颖的方法,在对同一体数据-报告对不同视角之间强制一致性的同时对体数据进行聚类。TMA 将文本特征整合到细粒度的视觉表示中,确保跨视角的上下文连贯性。我们在单模态和跨模态设置的多个下游任务中评估了 T3D,包括零样本和微调分类、跨模态检索、报告生成和语义分割。我们的结果表明,T3D 始终优于现有的 vSSL 和多模态方法,展现出卓越的零样本和微调能力,并为 3D 医学图像理解设定了新的基准。
引用
@article{arxiv.2312.01529,
title = {T3D: Advancing 3D Medical Vision-Language Pre-training by Learning Multi-View Visual Consistency},
author = {Che Liu and Cheng Ouyang and Yinda Chen and Cesar César Quilodrán-Casas and Lei Ma and Jie Fu and Yike Guo and Anand Shah and Wenjia Bai and Rossella Arcucci},
journal= {arXiv preprint arXiv:2312.01529},
year = {2025}
}