中文

VET-DINO: 基于多视图蒸馏在兽医影像中学习解剖理解

计算机视觉与模式识别 2025-05-22 v1 机器学习

摘要

自监督学习已成为训练深度神经网络的强大范式,尤其在标注数据稀缺的医学影像领域。虽然现有方法通常依赖单张图像的合成增强,但我们提出VET-DINO框架,利用医学影像的独特特性:来自同一研究的多个标准化视图。使用来自同一患者研究的系列临床兽医X光片,使模型能够学习尺度不变的解剖结构,并从二维投影中发展出隐含的三维理解。我们在来自668,000例犬类研究的500万例兽医X光片数据集上进行演示。通过广泛的实验,包括视图合成和下游任务性能,我们表明学习自然多视图对比显著优于纯合成增强。VET-DINO在各种兽医影像任务上实现了状态最佳性能。我们的工作为医学影像中基于领域特定属性的自监督学习确立了新的范式。

关键词

引用

@article{arxiv.2505.15248,
  title  = {VET-DINO: Learning Anatomical Understanding Through Multi-View Distillation in Veterinary Imaging},
  author = {Andre Dourson and Kylie Taylor and Xiaoli Qiao and Michael Fitzke},
  journal= {arXiv preprint arXiv:2505.15248},
  year   = {2025}
}