中文

认同于分歧:相同架构深度学习模型产生相异解释的现象

机器学习 2021-11-02 v2

摘要

神经网络的深度学习在医疗健康领域日益突出,模型已达到甚至超越专家准确水平。然而,这些成功案例被关于模型缺乏透明度和对某些医疗状况或患者子群偏见的令人担忧的报道所笼罩。可解释方法被视为缓解诸多此类担忧的途径。在本研究中,我们证明所生成的解释对垂直于分类任务和模型结构的模型训练变化是敏感的。这进一步引发了对医疗深度学习模型信任的疑问。主要是,模型是捕捉了数据中的潜在因果关联,还是仅依赖通过解释方法显现的虚假相关性。我们证明深度神经网络上可解释方法的输出会因超参数(如随机种子或训练集打乱方式)的变化而显著不同。我们引入一种解释一致性度量,并用于在 MIMIC-CXR 数据集上凸显所识别的问题。我们发现相同但训练设置不同的模型的解释具有较低的一致性:平均约 33%。相反,核方法对任意正交变化都具有鲁棒性,解释一致性达 94%。我们得出结论,当前模型解释的趋势不足以缓解在真实医疗应用中部署模型的风险。

关键词

引用

@article{arxiv.2105.06791,
  title  = {Agree to Disagree: When Deep Learning Models With Identical Architectures Produce Distinct Explanations},
  author = {Matthew Watson and Bashar Awwad Shiekh Hasan and Noura Al Moubayed},
  journal= {arXiv preprint arXiv:2105.06791},
  year   = {2021}
}

备注

9 pages, 5 figures, 3 tables