基于自编码器与 Vision Transformer 的第二与第三磨牙自动分期差异可解释性分析
计算机视觉与模式识别
2025-09-15 v1 人工智能
摘要
深度学习在高风险法医应用(如牙齿年龄估计)中的实际应用往往受到模型“黑盒”特性的限制。本研究引入了一个旨在在此背景下提升性能和透明度的框架。我们以下颌第二磨牙(牙位 37)和第三磨牙(牙位 38)自动分期中显著的性能差异作为案例研究。所提出的框架将卷积自编码器(AE)与 Vision Transformer (ViT) 相结合,与基线 ViT 相比提高了两颗牙齿的分类准确率,牙位 37 从 0.712 提升至 0.815,牙位 38 从 0.462 提升至 0.543。除了提高性能外,该框架还提供了多方面的诊断见解。对 AE 的潜空间指标和图像重建的分析表明,剩余的性能差距是以数据为中心的,这表明牙位 38 数据集中较高的类内形态变异性是主要的限制因素。这项工作强调了仅依赖单一可解释性模式(如注意力图)的不足,这些模式在解剖学上可能看起来合理,但无法识别潜在的数据问题。通过提供一种既能提高准确率又能为模型为何可能不确定提供证据的方法,该框架可作为支持法医年龄估计中专家决策的更稳健工具。
引用
@article{arxiv.2509.09911,
title = {An Autoencoder and Vision Transformer-based Interpretability Analysis of the Differences in Automated Staging of Second and Third Molars},
author = {Barkin Buyukcakir and Jannick De Tobel and Patrick Thevissen and Dirk Vandermeulen and Peter Claes},
journal= {arXiv preprint arXiv:2509.09911},
year = {2025}
}
备注
21 pages, 11 figures, Scientific Reports