中文

用于股骨骨折分类的视觉Transformer

人工智能 2021-10-27 v2

摘要

近年来,科学界致力于开发可改进骨折分类的 CAD 工具,大多基于卷积神经网络(CNN)。然而,对骨折亚型的辨别准确率远未达最优。本文提出了一种非常新颖且强大的深度学习技术——视觉Transformer(ViT)的改进版本,其性能超越基于 CNN 的方法,从而提高了专家的诊断准确率。我们使用了 4207 张手动标注的图像,并按照 AO/OTA 分类分布于不同骨折类型,这是文献中所用最大的近端股骨骨折标注数据集。采用 ViT 架构并与经典 CNN 及由级联连续 CNN 组成的多阶段架构进行比较。为证明该方法的可靠性:1)使用注意力图可视化图像中最相关的区域;2)通过无监督学习技术比较通用 CNN 与 ViT 的性能;3)邀请 11 位专家在有无 ViT 辅助下对 150 张近端股骨骨折图像进行评估与分类,随后比较结果以考察潜在改进。ViT 能正确预测 83% 的测试图像。精确率、召回率和 F1 分数分别为 0.77(CI 0.64-0.90)、0.76(CI 0.62-0.91)和 0.77(CI 0.64-0.89)。在 ViT 预测辅助下,专家诊断平均改善 29%,优于算法单独使用。本文展示了视觉Transformer在骨折分类中的潜力。首次在骨折亚型分类中取得良好结果,且使用了史上最大最丰富的数据集。据此,辅助诊断取得了最佳结果,再次证明了神经网络与专家协同工作的有效性。

关键词

引用

@article{arxiv.2108.03414,
  title  = {Vision Transformer for femur fracture classification},
  author = {Leonardo Tanzi and Andrea Audisio and Giansalvo Cirrincione and Alessandro Aprato and Enrico Vezzetti},
  journal= {arXiv preprint arXiv:2108.03414},
  year   = {2021}
}

备注

Under consideration at Artificial Intelligence in Medicine