RadJEPA:基于联合嵌入预测架构的胸部 X 光片放射学编码器
计算机视觉与模式识别
2026-05-27 v3
摘要
视觉-语言预训练推动了近期医学图像表征学习的大部分进展,但这种范式受到配对图像-文本数据可用性以及临床叙述报告偏差的限制。我们探讨了是否可以在没有任何语言监督的情况下学习到有竞争力的放射学编码器。我们引入了 RadJEPA,这是一个基于联合嵌入预测架构的自监督框架,并在约 84 万张无标签胸部 X 光图像上进行了预训练。该模型学习从可见的上下文区域预测掩码目标区域的潜在表征,这一目标不同于图像-文本对比预训练和 DINO 风格的自蒸馏,因为它显式地对表征空间中的条件结构进行建模。我们主要使用冻结的 Vicuna-7B 解码器在放射学报告生成任务上评估 RadJEPA,并额外将其编码器替换到四个广泛使用的视觉-语言骨干网络(MedLLaVA、Qwen-2.5、BLIP-2 和 Phi-4)中。为完整性起见,我们还报告了疾病分类和语义分割的结果。在两个数据集和四个指标上,RadJEPA 在使用 ViT-B/14 骨干和 224 x 224 分辨率的情况下,匹配或超越了最强的纯图像和视觉-语言基线。
引用
@article{arxiv.2601.15891,
title = {RadJEPA: Radiology Encoder for Chest X-Rays via Joint Embedding Predictive Architecture},
author = {Anas Anwarul Haq Khan and Mariam Husain and Pratik Jalan and Kshitij Jadhav},
journal= {arXiv preprint arXiv:2601.15891},
year = {2026}
}