中文

面向开放集噪声标签学习的实例校正

机器学习 2021-06-02 v1

摘要

开放集噪声标签问题是指部分训练数据具有不包含真实类别的不同标签空间。许多方法,例如损失校正和标签校正,不能很好地处理此类开放集噪声标签,因为它们需要训练数据与测试数据共享同一标签空间,而这在学习带开放集噪声标签时不成立。因此最先进的方法采用样本选择方法来处理开放集噪声标签,其试图从噪声数据中选出干净数据用于网络参数更新。被丢弃的数据被视为错标且不参与训练。这种方法初看直观且合理。然而,一个自然的问题可被提出:“这些数据在训练中只能被丢弃吗?”。本文中,我们表明答案是否定的。具体而言,我们论述被丢弃数据的实例可能包含某些对泛化有意义的信息。为此,我们不放弃这些数据,而是使用实例校正来修改被丢弃数据的实例,使被丢弃数据的预测与给定标签一致。实例校正通过定向对抗攻击实现。校正后的数据随后被用于训练以帮助泛化。除分析结果外,我们还提供了一系列经验证据来佐证我们的主张。

关键词

引用

@article{arxiv.2106.00455,
  title  = {Instance Correction for Learning with Open-set Noisy Labels},
  author = {Xiaobo Xia and Tongliang Liu and Bo Han and Mingming Gong and Jun Yu and Gang Niu and Masashi Sugiyama},
  journal= {arXiv preprint arXiv:2106.00455},
  year   = {2021}
}