VELVET-Med:面向医学体积成像任务的视觉与高效语言预训练
计算机视觉与模式识别
2025-08-19 v1
摘要
视觉语言模型 (VLM) 在医学领域得到广泛探索,尤其是继 CLIP 在通用领域取得成功后。然而,与 2D 图像与文本的相对直接配对不同,为体积模态(如 CT 扫描) curate 大规模配对数据在医学领域仍具有挑战性且耗时。这一困难常常限制下游任务的性能。为此,我们提出一种新型视觉语言预训练 (VLP) 框架,称为 \textbf{VELVET-Med},专为有限体积数据(如 3D CT 和相关放射学报告)设计。不依赖大规模数据收集,我们的方法聚焦于有效预训练目标和模型架构的开发。我们的主要贡献包括:1) 将单模态自监督学习融入 VLP 框架,这在现有文献中常被忽视;2) 提出一种新型语言编码器 \textbf{TriBERT},用于学习多层文本语义;3) 设计分层对比学习以捕获多层次视觉语言对应关系。仅使用 38,875 对扫描-报告配对,我们的方法寻求揭示体积医学图像及其临床叙述中蕴含的丰富空间和语义关系,从而增强所学编码器的泛化能力。所得编码器在广泛的下游任务上表现出强大的可迁移性,包括 3D 分段、跨模态检索、视觉问答和报告生成,实现了最先进的性能。
引用
@article{arxiv.2508.12108,
title = {VELVET-Med: Vision and Efficient Language Pre-training for Volumetric Imaging Tasks in Medicine},
author = {Ziyang Zhang and Yang Yu and Xulei Yang and Si Yong Yeo},
journal= {arXiv preprint arXiv:2508.12108},
year = {2025}
}