中文

具有模糊任务边界和噪声标签的数据流采样

机器学习 2024-04-09 v1 人工智能 计算机视觉与模式识别

摘要

在持续学习领域,数据流中噪声标签的存在对模型的可靠性和公平性构成了显著障碍。我们关注相关文献中描述的数据流场景,其特征是模糊的任务边界和噪声标签。为了应对这一挑战,我们引入了一种新颖且直观的采样方法,称为噪声测试去偏(NTD),以减轻演化数据流中的噪声标签,并建立公平且稳健的持续学习算法。NTD 易于实现,使其在各种场景中均可行。我们的实验在四个数据集上进行了基准测试,包括两个合成噪声数据集(CIFAR10 和 CIFAR100)以及真实世界噪声数据集(mini-WebVision 和 Food-101N)。结果验证了 NTD 在数据流中存在噪声标签场景下用于在线持续学习的有效性。与之前的领先方法相比,NTD 在保持或超越准确率水平的同时,实现了两倍以上的训练加速。此外,与之前的领先方法相比,NTD 使用的 GPU 内存资源不到其五分之一。

关键词

引用

@article{arxiv.2404.04871,
  title  = {Data Stream Sampling with Fuzzy Task Boundaries and Noisy Labels},
  author = {Yu-Hsi Chen},
  journal= {arXiv preprint arXiv:2404.04871},
  year   = {2024}
}