中文

基于示例解释的交互式标签清洗

机器学习 2021-12-16 v3 机器学习

摘要

我们解决在标签噪声下的序列学习问题,其中可查询人类监督者以重新标注可疑样本。现有方法存在缺陷,因为它们仅重新标注模型看来“可疑”的 incoming 样本。结果,那些逃脱(或未经历)此清洗步骤的错标样本最终污染了训练数据和模型,且不再有被清洗的机会。我们提出 Cincer,一种通过识别相互不兼容的样本对来清洗新数据和历史数据的新方法。每当检测到可疑样本时,Cincer 会在训练集中识别一个根据模型判断与该可疑样本最大不兼容的反例,并请求标注者重新标注其中之一或两者,以解决这种可能的不一致。反例被选择为最大不兼容,以作为模型怀疑原因的解释,并且具有高度影响力,从而若被重新标注则传达尽可能多的信息。Cincer 通过利用基于 Fisher 信息矩阵(FIM)的高效且鲁棒的影响函数近似来实现这一点。我们广泛的实证评估表明,通过清洗反例来澄清模型怀疑背后的原因,有助于获取显著更好的数据和模型,尤其是与我们的 FIM 近似结合使用时。

关键词

引用

@article{arxiv.2106.03922,
  title  = {Interactive Label Cleaning with Example-based Explanations},
  author = {Stefano Teso and Andrea Bontempelli and Fausto Giunchiglia and Andrea Passerini},
  journal= {arXiv preprint arXiv:2106.03922},
  year   = {2021}
}

备注

main article + supplementary material, Advances in Neural Information Processing Systems 34 (NeurIPS 2021)