中文

验证 Vision Transformers 在耳鼻喉科诊断中的性能与数据泄漏效应

计算机视觉与模式识别 2025-11-14 v1

摘要

本研究评估了以视觉转换器模型(特别是 Swin 转换器)在提高耳部疾病诊断准确率方面的效果,与传统卷积神经网络相比较。据报道,专业耳鼻喉科医生存在 27% 的误诊率,提高诊断准确率至关重要。该研究利用智利 Universidad de Chile 临床医院耳鼻喉科部门收集的真实数据集,包含 various middle 和 external ear conditions 的耳部检查视频。根据拉普拉斯和 Shannon 熵阈值选取帧,并移除空白帧。初始情况下,Swin v1 和 Swin v2 转换器模型分别实现了 100% 和 99.1% 的准确率,略高于 ResNet 模型(99.5%)。这些结果超越了相关研究中报告的指标。然而,评估发现预处理步骤中存在关键数据泄漏问题,影响了本研究以及使用相同原始数据集的相关研究。在消除数据泄漏后,模型性能显著下降。纠正后的准确率分别为 Swin v1 和 Swin v2 为 83%,ResNet 为 82%。这一发现凸显了在机器学习研究中尤其在医学应用中严格数据处理的重要性。该研究表明,尽管视觉转换器显示出前景,但发现在先进模型架构的优势与有效数据预处理方法之间找到最佳平衡,对于开发可靠的用于诊断耳部疾病的机器学习模型至关重要。

关键词

引用

@article{arxiv.2511.04872,
  title  = {Validating Vision Transformers for Otoscopy: Performance and Data-Leakage Effects},
  author = {James Ndubuisi and Fernando Auat and Marta Vallejo},
  journal= {arXiv preprint arXiv:2511.04872},
  year   = {2025}
}