面向偏斜数据集的主动学习
机器学习
2020-05-26 v1 机器学习
摘要
考虑一个序贯主动学习问题,其中在每一轮,一个智能体选择一批未标注数据点,查询它们的标签并更新一个二分类器。虽然关于这种一般形式的主动学习已有大量研究,但在本文中,我们聚焦于具有两个显著特征的问题:严重的类别不平衡(偏斜)和少量的初始训练数据。这两个问题在许多网络应用中以惊人的频率出现。例如,检测在线社区中的攻击性或敏感内容(色情、暴力和仇恨言论)正受到工业界和研究界的极大关注。此类问题兼具我们所描述的两个特征——绝大多数内容并非攻击性,因此此类内容的正面样本数量比负面样本少几个数量级。此外,在构建机器学习模型来解决此类问题时,通常只有少量初始训练数据可用。为了同时解决这两个问题,我们提出了一种混合主动学习算法(HAL),该算法平衡了对当前已标注训练样本中可用知识的利用与对大量未标注数据的探索。通过仿真结果,我们表明,与诸如边缘采样等强基线相比,HAL 在选择要标注的点方面做出了显著更好的选择。在给定相同标注预算的情况下,基于 HAL 所选标注样本训练的分类器在目标指标(如精确率-召回率曲线下面积)上轻松超越了基线。我们相信,HAL 为广泛的机器学习应用提供了一种简单、直观且计算上易于处理的方式来构建主动学习。
引用
@article{arxiv.2005.11442,
title = {Active Learning for Skewed Data Sets},
author = {Abbas Kazerouni and Qi Zhao and Jing Xie and Sandeep Tata and Marc Najork},
journal= {arXiv preprint arXiv:2005.11442},
year = {2020}
}