Pretext Matters:医学影像中 SSL 方法的实证研究
计算机视觉与模式识别
2026-03-25 v1
摘要
虽然自监督学习(SSL)在从无标签数据中学习鲁棒表征方面展现出惊人的能力,但最佳 SSL 策略的选择可能在专业领域内导致截然不同的性能结果。联合嵌入架构(JEAs)和联合嵌入预测架构(JEPAs)相较于基于像素重构的 SSL 方法表现出对噪声的鲁棒性和强语义特征学习能力,因而在医学影像中得到广泛采用。然而,尚无前期工作系统性地检讨哪种 SSL 目标更符合临床相关信号的空间组织结构。在本工作中,我们实证研究 SSL 方法的选择如何影响医学影像中所学习的表征。我们选取两种具有独特噪声轮廓的代表性影像模态:超声和组织病理学。当信息在空间上局部化时(如组织病理学中),JEAs 更为有效,因为其具有视图不变性目标。相比之下,当诊断相关信息具有全局结构时(如肝脏超声中呈现的宏观解剖),JEPAs 更为优越。这些差异在所学习特征的临床相关性方面尤为明显,由具备执业资质的放射科医生和病理科医生独立验证。综合而言,我们的结果为将 SSL 目标匹配到医学影像模态的结构和噪声特性提供了一套框架。
引用
@article{arxiv.2603.22649,
title = {Pretext Matters: An Empirical Study of SSL Methods in Medical Imaging},
author = {Vedrana Ivezić and Mara Pleasure and Ashwath Radhachandran and Saarang Panchavati and Shreeram Athreya and Vivek Sant and Benjamin Emert and Gregory Fishbein and Corey Arnold and William Speier},
journal= {arXiv preprint arXiv:2603.22649},
year = {2026}
}