PiPViT:基于块的可视化可解释原型用于视网膜图像分析
计算机视觉与模式识别
2025-06-16 v2 人工智能
摘要
背景与目标:基于原型的方法通过学习细粒度部分原型来提高可解释性;然而,其在输入像素空间中的可视化并不总是与人类可理解的生物标志物一致。此外,著名的基于原型的方法通常学习极其细粒度的原型,在医学成像中可解释性较差,而医学成像中生物标志物和病变的存在与范围都至关重要。方法:为解决这些挑战,我们提出了PiPViT(基于块的可视化可解释原型),一种天然可解释的原型化图像识别模型。利用视觉Transformer(ViT),PiPViT捕获块之间的长程依赖关系,学习鲁棒的、人类可解释的原型,仅使用图像级标签即可近似病变范围。此外,PiPViT受益于对比学习和多分辨率输入处理,使其能够在多个尺度上有效定位生物标志物。结果:我们在四个数据集上对PiPViT进行了视网膜OCT图像分类评估,其定量性能与最先进方法具有竞争力,同时提供了更有意义的解释。此外,在保留测试集上的定量评估确认了所学习原型在语义和临床上的相关性。我们相信PiPViT可以透明地解释其决策,并辅助临床医生理解诊断结果。Github页面:https://github.com/marziehoghbaie/PiPViT
引用
@article{arxiv.2506.10669,
title = {PiPViT: Patch-based Visual Interpretable Prototypes for Retinal Image Analysis},
author = {Marzieh Oghbaie and Teresa Araújo and Hrvoje Bogunović},
journal= {arXiv preprint arXiv:2506.10669},
year = {2025}
}