面向基于Transformer的胸片X光诊断的混合解释引导学习
计算机视觉与模式识别
2025-10-15 v1 人工智能
摘要
基于Transformer的深度学习模型在医学影像中表现出卓越的性能,利用注意力机制进行特征表示和可解释性。然而,这些模型容易学习虚假关联,导致偏见和有限的泛化能力。虽然人类-AI注意力对齐可以缓解这些问题,但往往依赖于高成本的手动监督。在本工作中,我们提出了混合解释引导学习(H-EGL)框架,结合自监督和人类引导的约束,以增强注意力对齐并提高泛化能力。H-EGL的自监督组件利用类别差异化注意力,无需依赖限制性先验条件,从而促进鲁棒性和灵活性。我们在胸片X光分类中使用Vision Transformer(ViT)进行验证,其中H-EGL超过两个最先进的解释引导学习(EGL)方法,显示出卓越的分类准确率和泛化能力。此外,它产生的注意力图与人类专家意图的对齐程度更好。
引用
@article{arxiv.2510.12704,
title = {Hybrid Explanation-Guided Learning for Transformer-Based Chest X-Ray Diagnosis},
author = {Shelley Zixin Shu and Haozhe Luo and Alexander Poellinger and Mauricio Reyes},
journal= {arXiv preprint arXiv:2510.12704},
year = {2025}
}
备注
Accepted by iMIMIC at MICCAI 2025