CXR-LanIC:胸片诊断的语言 grounding 可解释分类器
计算机视觉与模式识别
2026-05-20 v4
摘要
深度学习模型在胸片诊断中取得了显著的准确率,但由于其黑箱本质,仍未得到广泛的临床应用。医生需要透明、可验证的解释来信任自动诊断并识别潜在的失效模式。我们引入CXR-LanIC(Language-Grounded Interpretable Classifier for Chest X-rays),一种新型框架,通过任务对齐模式发现来解决此可解释性挑战。我们的方法在BiomedCLIP诊断分类器上训练基于转码器的稀疏自编码器,将医学图像表示分解为可解释的视觉模式。通过在MIMIC-CXR数据集上的多模态嵌入上训练100个转码器,我们发现约5000个单语义模式,涵盖心脏、肺部、胸膜、结构、器械和伪影类别。每个模式在具有特定放射学特征的图像之间表现出一致的激活行为,使可解释的归因成为可能,其中预测分解为20-50个可解释模式,伴随可验证的激活画廊。CXR-LanIC在五个关键发现上实现了竞争的诊断准确率,同时通过计划的大型多模态模型注释,为自然语言解释提供了基础。我们的关键创新在于从在特定诊断目标上训练的分类器(而非通用嵌入)中提取可解释特征,确保发现的模式直接与临床决策相关,表明医疗AI系统可以既准确又可解释,通过透明、临床导向的解释支持更安全的临床部署。
关键词
引用
@article{arxiv.2510.21464,
title = {CXR-LanIC: Language-Grounded Interpretable Classifier for Chest X-Ray Diagnosis},
author = {Yiming Tang and Wenjia Zhong and Rushi Shah and Dianbo Liu},
journal= {arXiv preprint arXiv:2510.21464},
year = {2026}
}