面向数据流的主动学习:综述
机器学习
2023-12-01 v4 机器学习
统计方法学
摘要
在线主动学习是机器学习中的一种范式,旨在从数据流中选取信息量最大的数据点进行标注。近年来,与收集标注观测相关成本最小化的问题备受关注,尤其在数据仅以无标注形式可用的真实应用中。标注每个观测可能耗时且昂贵,使得获取大量标注数据十分困难。为克服该问题,过去几十年提出了许多主动学习策略,旨在选取信息量最大的观测进行标注,以提升机器学习模型性能。这些方法可大致分为两类:静态池式与流式主动学习。池式主动学习涉及从封闭的无标注数据池中选取子集,已是诸多综述与文献回顾的焦点。然而,数据流可用性的增长导致聚焦于在线主动学习的方法增多,后者涉及在观测随流到达时持续选取并标注。本文旨在概述近期提出的、用于实时从数据流中选取信息量最大观测的方法。我们回顾了各类已提出的技术,讨论其优势与局限,以及该研究领域存在的挑战与机遇。
引用
@article{arxiv.2302.08893,
title = {Active learning for data streams: a survey},
author = {Davide Cacciarelli and Murat Kulahci},
journal= {arXiv preprint arXiv:2302.08893},
year = {2023}
}
备注
Published in Machine Learning (2023)