DiSSECT:通过离散自监督构建可迁移的医学图像表示
计算机视觉与模式识别
2025-09-24 v1 人工智能
摘要
自监督学习(SSL)已成为医学图像表示学习的强大范式,特别是在标注数据有限的情况下。然而,现有的 SSL 方法通常依赖于复杂的架构、特定解剖结构的先验或高度调优的数据增强,这限制了它们的可扩展性和泛化能力。更关键的是,这些模型容易产生捷径学习,特别是在胸部 X 射线等解剖结构相似度高且病理特征微妙的模态中。在这项工作中,我们引入了 DiSSECT——用于高效临床可迁移表示的离散自监督,这是一个将多尺度向量量化集成到 SSL 流程中以施加离散表示瓶颈的框架。这约束模型学习可重复的、结构感知的特征,同时抑制特定视图或低效用的模式,从而改善跨任务和跨领域的表示迁移。DiSSECT 在分类和分割任务上均取得了强劲的性能,需要极少或无需微调,并在低标注机制下表现出特别高的标注效率。我们在多个公共医学影像数据集上验证了 DiSSECT,证明了其与现有最先进方法相比的鲁棒性和泛化能力。
引用
@article{arxiv.2509.18765,
title = {DiSSECT: Structuring Transfer-Ready Medical Image Representations through Discrete Self-Supervision},
author = {Azad Singh and Deepak Mishra},
journal= {arXiv preprint arXiv:2509.18765},
year = {2025}
}