中文

面向数据流的主动学习:综述

机器学习 2023-12-01 v4 机器学习 统计方法学

摘要

在线主动学习是机器学习中的一种范式,旨在从数据流中选取信息量最大的数据点进行标注。近年来,与收集标注观测相关成本最小化的问题备受关注,尤其在数据仅以无标注形式可用的真实应用中。标注每个观测可能耗时且昂贵,使得获取大量标注数据十分困难。为克服该问题,过去几十年提出了许多主动学习策略,旨在选取信息量最大的观测进行标注,以提升机器学习模型性能。这些方法可大致分为两类:静态池式与流式主动学习。池式主动学习涉及从封闭的无标注数据池中选取子集,已是诸多综述与文献回顾的焦点。然而,数据流可用性的增长导致聚焦于在线主动学习的方法增多,后者涉及在观测随流到达时持续选取并标注。本文旨在概述近期提出的、用于实时从数据流中选取信息量最大观测的方法。我们回顾了各类已提出的技术,讨论其优势与局限,以及该研究领域存在的挑战与机遇。

关键词

引用

@article{arxiv.2302.08893,
  title  = {Active learning for data streams: a survey},
  author = {Davide Cacciarelli and Murat Kulahci},
  journal= {arXiv preprint arXiv:2302.08893},
  year   = {2023}
}

备注

Published in Machine Learning (2023)