QActor:面向带噪标签流数据的在线主动学习
机器学习
2020-01-29 v1 机器学习
摘要
对于持续发布在网页和社交媒体上的自生成内容,带噪标签数据与其说是罕见不如说是常态。由于隐私问题和政府法规,此类数据流只能被存储并在有限时间内用于学习目的。为克服该在线场景中的噪声,我们提出QActor,其新颖地结合了:通过质量模型筛选疑似干净样本,以及主动查询oracle以获取信息量最大的真实标签。前者可能受限于在线场景的低数据量,而后者受限于人类专家的可用性与成本。QActor迅速结合了质量模型用于数据过滤与oracle查询用于清洗最具信息量数据的优点。QActor的目标是利用严苛的oracle预算稳健地最大化学习准确率。QActor探索了结合不同查询分配与不确定性度量的多种策略。QActor的一个核心特征是根据每个数据批次的学习损失动态调整查询上限。我们广泛评估了输入分类器的不同图像数据集,该分类器可以是标准机器学习(ML)模型或深度神经网络(DNN),噪声标签比例介于30%至80%之间。我们的结果表明,QActor几乎可以匹配仅使用干净数据所达到的最优准确率,而代价是最多额外使用来自oracle的6%的ground truth数据。
引用
@article{arxiv.2001.10399,
title = {QActor: On-line Active Learning for Noisy Labeled Stream Data},
author = {Taraneh Younesian and Zilong Zhao and Amirmasoud Ghiassi and Robert Birke and Lydia Y. Chen},
journal= {arXiv preprint arXiv:2001.10399},
year = {2020}
}