深度学习用于口腔健康:对 ViT、DeiT、BEiT、ConvNeXt 与 Swin Transformer 的基准评测
计算机视觉与模式识别
2025-09-30 v1
摘要
目的:本研究旨在系统评估并比较五种最先进的基于 Transformer 的架构——Vision Transformer (ViT)、Data-efficient Image Transformer (DeiT)、ConvNeXt、Swin Transformer 和 Bidirectional Encoder Representation from Image Transformers (BEiT)——在多类别牙科疾病分类中的性能。研究特别关注解决现实世界中的挑战,例如现有文献中常被忽视的数据不平衡问题。研究设计:使用 Oral Diseases 数据集训练和验证所选模型。测量了包括验证准确率、精确率、召回率和 F1 分数在内的性能指标,并特别强调了每种架构处理不平衡类别的能力。结果:ConvNeXt 取得了最高的验证准确率,达到 81.06%,其次是 BEiT 的 80.00% 和 Swin Transformer 的 79.73%,三者均表现出很强的 F1 分数。ViT 和 DeiT 的准确率分别为 79.37% 和 78.79%,但两者在与龋齿相关的类别上表现尤为挣扎。结论:ConvNeXt、Swin Transformer 和 BEiT 显示出可靠的诊断性能,使其成为牙科影像临床应用中很有前景的候选方案。这些发现为未来 AI 驱动的口腔疾病诊断工具中的模型选择提供了指导,并强调了在现实场景中解决数据不平衡问题的重要性。
引用
@article{arxiv.2509.23100,
title = {Deep Learning for Oral Health: Benchmarking ViT, DeiT, BEiT, ConvNeXt, and Swin Transformer},
author = {Ajo Babu George and Sadhvik Bathini and Niranjana S R},
journal= {arXiv preprint arXiv:2509.23100},
year = {2025}
}
备注
9 pages,3 figures