冷启动下不平衡数据的主动学习
机器学习
2021-10-25 v2 机器学习
摘要
依赖机器学习(ML)进行预测建模的现代系统可能受冷启动问题困扰:监督模型表现良好,但初始无标签,而标签获取成本高或慢。在不平衡数据场景中此问题更糟,正类标签积累更久。我们提出一种面向量级类不平衡数据集、冷启动流场景的主动学习(AL)系统。我们给出计算高效的基于离群点的判别 AL 方法(ODAL),并设计新颖的 3 阶段 AL 标注策略序列,其中 ODAL 用作预热。随后在四个具不同类不平衡量级的真实数据集做实证研究。结果显示,相较无 ODAL 预热的标准 AL 策略,我们的方法能更快得到高性能模型。其相对随机采样的可观测收益可达 80%,且与具无限标注预算或额外历史数据的策略竞争(仅用 2% 至 10% 标签)。
引用
@article{arxiv.2107.07724,
title = {Active learning for imbalanced data under cold start},
author = {Ricardo Barata and Miguel Leite and Ricardo Pacheco and Marco O. P. Sampaio and João Tiago Ascensão and Pedro Bizarro},
journal= {arXiv preprint arXiv:2107.07724},
year = {2021}
}
备注
9 pages, 6 figures, 2 tables