中文

基于熵去偏后的去噪:一种针对含噪标签数据集偏置的鲁棒训练方法

机器学习 2022-12-05 v1 人工智能

摘要

构建不当的数据集会导致不准确的推断。例如,在偏置数据集上训练的模型泛化性能较差(即数据集偏置)。近期的去偏技术通过低估易学样本(即与偏置对齐的样本)并突出难学样本(即与偏置冲突的样本)成功实现了泛化性能。然而,这些技术可能因噪声标签而失效,因为训练后的模型将噪声标签识别为难学样本从而对其加以突出。在本研究中,我们发现以往使用给定标签来量化难学程度的方法会受到少量噪声标签的影响。此外,我们发现去偏之前运行去噪算法是无效的,因为去噪算法会削弱难学样本(包括有价值的与偏置冲突的样本)的影响。因此,我们提出了一种称为基于熵去偏后的去噪(即 DENEB)的方法,其包含三个主要阶段。(1)通过强调使用高斯混合模型筛选出的(与偏置对齐的、干净的)样本来训练偏见模型。(2)利用偏见模型输出中每个样本的样本熵,计算与熵成正比的各样本采样概率。(3)使用现有去噪算法,依据计算得到的采样概率所构建的小批量数据训练最终模型。与现有的去偏和去噪算法相比,我们的方法在多个基准上取得了更好的去偏性能。

关键词

引用

@article{arxiv.2212.01189,
  title  = {Denoising after Entropy-based Debiasing A Robust Training Method for Dataset Bias with Noisy Labels},
  author = {Sumyeong Ahn and Se-Young Yun},
  journal= {arXiv preprint arXiv:2212.01189},
  year   = {2022}
}

备注

37th AAAI Conference on Artificial Intelligence (AAAI'23)