中文

压缩模型中的偏差特征刻画

机器学习 2020-12-21 v2 人工智能

摘要

剪枝和量化之所以流行并被广泛使用,其驱动力在于将深度神经网络部署到具有严格延迟、内存和能耗要求的环境时所面临的严峻资源约束。这些技术在顶级指标(top-1 和 top-5 准确率)上影响可忽略的情况下实现了高水平的压缩。然而,整体准确率掩盖了在一小部分样本上不成比例的高错误率;我们将这一子集称为压缩识别样本(Compression Identified Exemplars, CIE)。我们进一步证实,对于 CIE 样本,压缩放大了已有的算法偏差。剪枝对代表性不足的特征的性能影响尤为严重,而这往往与公平性考量相重合。鉴于 CIE 是相对较小的子集却是模型错误的主要贡献者,我们提议将其用作人在回路审计工具,以暴露数据集中一个易于处理的子集,供领域专家进一步审查或标注。我们提供定性和定量证据,表明 CIE 能够暴露数据分布中最具挑战性的样本,用于人在回路审计。

关键词

引用

@article{arxiv.2010.03058,
  title  = {Characterising Bias in Compressed Models},
  author = {Sara Hooker and Nyalleng Moorosi and Gregory Clark and Samy Bengio and Emily Denton},
  journal= {arXiv preprint arXiv:2010.03058},
  year   = {2020}
}