中文

揭示模型偏差:通过恢复样本分析评估深度神经网络

计算机视觉与模式识别 2023-06-13 v1

摘要

本文提出一种直接且经济的方法,用于评估深度神经网络(DNN)是依赖于训练样本的主要概念,还是仅仅学习了可区分但简单且无关的特征以区分各类别。论文强调,DNN作为判别分类器,常寻找最简单的特征来区分类别,导致可能对无关特征产生偏向,并有时缺失泛化能力。虽然泛化测试是评估训练模型性能的一种方式,但它可能代价高昂,且无法覆盖所有场景以确保模型学习了主要概念。此外,即便进行了泛化测试,也可能无法识别模型中的偏差。为此,本文提出一种方法,涉及从训练模型的参数中恢复样本并分析其重建质量。我们认为,若模型权重被优化为基于某些特征进行判别,这些特征将反映在重建样本中。若恢复样本包含训练数据的主要概念,可得出结论模型已学习本质性与决定性特征。反之,若恢复样本包含无关特征,可得出结论模型对这些特征存在偏向。所提方法不需要任何测试或泛化样本,仅需训练模型的参数及位于边界上的训练数据。我们的实验表明,该方法能判定模型是否学习了训练数据的期望特征。论文指出,我们对这些模型如何工作的理解有限,所提方法解决了这一问题。

关键词

引用

@article{arxiv.2306.06414,
  title  = {Revealing Model Biases: Assessing Deep Neural Networks via Recovered Sample Analysis},
  author = {Mohammad Mahdi Mehmanchi and Mahbod Nouri and Mohammad Sabokrou},
  journal= {arXiv preprint arXiv:2306.06414},
  year   = {2023}
}