中文

数据流分类中的在线数据增强与主动学习

机器学习 2025-08-25 v1

摘要

由于众多机器学习应用中数据以在线方式到达,对模型进行在线训练的迫切需求正在涌现。遇到的一个关键挑战是,当新数据逐个在线观测时, ground truth信息(如分类任务中的标签)的可用性有限;另一个重大挑战是类不平衡。本工作引入了新颖的增强队列(Augmented Queues)方法,该方法通过协同结合在线主动学习、数据增强和多队列记忆,为每个类维护独立且平衡的队列,从而解决这一双重问题。我们使用图像和时间序列增强进行了广泛的实验研究,考察了主动学习预算、记忆大小、不平衡水平和神经网络类型的作用。我们展示了增强队列的两大优势。首先,它不预留额外内存空间,因为合成数据的生成仅发生在训练时刻。其次,学习模型无需增加主动学习预算和/或原始记忆大小即可访问更多带标签数据。在线学习带来了重大挑战,通常阻碍学习模型的部署。增强队列在学习的质与速方面显著提升了性能。我们的代码已公开可用。

关键词

引用

@article{arxiv.2210.06873,
  title  = {Data augmentation on-the-fly and active learning in data stream classification},
  author = {Kleanthis Malialis and Dimitris Papatheodoulou and Stylianos Filippou and Christos G. Panayiotou and Marios M. Polycarpou},
  journal= {arXiv preprint arXiv:2210.06873},
  year   = {2025}
}

备注

Keywords: incremental learning, active learning, data streams, class imbalance, neural networks