面向肾结石图像分类的 Vision Transformer 研究:与 CNN 的比较分析
计算机视觉与模式识别
2025-08-22 v2 机器学习
摘要
从内窥镜图像中对肾结石进行分类对于个体化治疗和复发预防至关重要。虽然卷积神经网络(CNN)在该任务中显示出前景,但其捕获长程依赖能力有限,在可变成像条件下可能影响性能。本研究对Vision Transformer(ViT)与CNN基模型进行比较分析,在两个活体数据集(包括CCD相机和柔性导管镜图像)上进行评估。实验结果表明,ImageNet-21k 预训练的ViT-base模型在多种成像条件下持续优于ResNet50基线。例如,在最具视觉复杂度的子集(来自内窥镜图像的切片)中,ViT模型实现了95.2%的准确率和95.1%的F1分数,远超ResNet50的64.5%和59.3%。在来自CCD相机图像的混合视图子集中,ViT达到了87.1%的准确率,而CNN仅为78.4%。这些改进也体现在精确率和召回率上。实验结果表明,ViT架构提供了优越的分类性能,为肾结石图像分析提供了可扩展的CNN替代方案。
引用
@article{arxiv.2508.13461,
title = {Vision Transformers for Kidney Stone Image Classification: A Comparative Study with CNNs},
author = {Ivan Reyes-Amezcua and Francisco Lopez-Tiro and Clement Larose and Andres Mendez-Vazquez and Gilberto Ochoa-Ruiz and Christian Daul},
journal= {arXiv preprint arXiv:2508.13461},
year = {2025}
}