中文

协方差描述子与通用视觉编码器:基于黎曼几何的医学图像分类

计算机视觉与模式识别 2025-11-07 v1

摘要

协方差描述子捕捉图像特征的二阶统计信息。它们在一般计算机视觉任务中显示出强大的性能,但在医学成像领域仍鲜有探索。我们研究其在常规和基于学习的医学图像分类中的有效性,特别关注针对对称正定(SPD)矩阵设计的分类网络SPDNet。我们提出构建来自由预训练通用视觉编码器提取特征的协方差描述子,并与手工描述子进行比较。评估了两个视觉编码器——DINOv2和MedSAM——在来自MedMNSIT基准的十一个二分类和多分类数据集上的表现。我们的结果表明,来自视觉编码器特征的协方差描述子 consistently优于来自手工特征的协方差描述子。此外,SPDNet在结合DINOv2特征时优于现有方法。我们的发现凸显了将协方差描述子与强大的预训练视觉编码器结合用于医学图像分析的潜力。

关键词

引用

@article{arxiv.2511.04190,
  title  = {Covariance Descriptors Meet General Vision Encoders: Riemannian Deep Learning for Medical Image Classification},
  author = {Josef Mayr and Anna Reithmeir and Maxime Di Folco and Julia A. Schnabel},
  journal= {arXiv preprint arXiv:2511.04190},
  year   = {2025}
}

备注

Preprint. Submitted to the IEEE International Symposium on Biomedical Imaging (ISBI) 2026